Le Dots Model Lab de Xiaohongshu a publié en open source dots3-note Preview aujourd'hui — poids sur Hugging Face et GitHub, Apache 2.0, architecture déjà soumise à Transformers pour un support de bibliothèque dès le premier jour. Xiaohongshu, c'est RedNote, l'appli lifestyle et sociale — pas une entreprise qu'on attendait dans les sorties de modèles en poids ouverts de frontière, bien que son équipe Dots ait déjà livré dots.llm et dots.ocr — c'est sa première entrée dans l'étage raisonnement-et-agents. Note est le plus petit d'une famille dots3 de trois modèles prévue (note, jazz, aria) — 280B de paramètres au total, 16B actifs, contexte de 512K, multimodal en texte, vision et parole.
L'affirmation phare, et la précision qu'elle exige
Enfouie dans une section sur l'auto-évaluation plutôt qu'en tête de lancement : à l'OIM 2026 le mois dernier, un harnais interne construit autour d'une branche de dots3-note Preview a généré des preuves de manière récursive, utilisé des outils pour les évaluer et les améliorer, et obtenu un score parfait certifié officiellement de 42/42 — une médaille d'or à l'OIM. Ce « certifié » compte ; cela signifie que le résultat est passé par la notation réelle de la compétition, pas une affirmation auto-déclarée. Cela mérite aussi d'être lu précisément : c'était « une branche de » la version préversion, tournant dans un harnais construit sur mesure pour la génération récursive de preuves — pas nécessairement identique bit à bit au checkpoint qui se trouve maintenant sur Hugging Face. L'écart entre « la capacité qui a gagné l'or » et « l'artefact que vous pouvez télécharger » est le même écart que nous avons signalé dans d'autres sorties ce mois-ci, et cela vaut la peine de vérifier le rapport technique, attendu dans la semaine, pour savoir exactement ce qui diffère.
TEMPO : une vraie réponse à la question de savoir pourquoi le RL à long horizon casse continuellement
La contribution la plus durable ici est peut-être méthodologique. Le RL acteur-critique standard (PPO et similaires) peine sur les tâches d'agent à long horizon pour une raison précise que l'équipe énonce clairement : un seul déploiement (rollout) peut durer plus de dix heures, rendant l'entraînement d'une lenteur prohibitive, tandis qu'un critique qui estime la valeur via une passe avant à calcul fixe ne peut pas raisonner, réfléchir, ou utiliser des outils pour juger un état intermédiaire complexe de la façon dont l'acteur le peut.
Leur solution, TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization), décompose une tâche longue en macro-étapes. À la fin de chacune, le même agent change de rôle, passant d'acteur à critique, en utilisant un raisonnement mis à l'échelle au moment de l'inférence — pas un modèle séparé et moins cher — pour estimer le rendement restant attendu avant même que la tâche ne soit terminée. La politique se met à jour sur cette estimation plutôt que d'attendre la fin des dix heures de déploiement. Sur ARC-AGI-3, TEMPO obtient un score 31,5 % plus élevé que le checkpoint de référence et 20,6 % plus élevé que GRPO, et atteint un score donné en moins d'étapes. L'exemple travaillé par l'équipe elle-même est une illustration nette : deux trajectoires d'entraînement sur un puzzle de satisfaction de contraintes ont toutes deux tourné 64 tours avec des scores d'environnement identiques, indiscernables par le seul résultat — mais l'une avait réellement trouvé la règle cachée du puzzle et l'autre s'était accrochée à une hypothèse fausse, et l'étape d'auto-critique de TEMPO les a distinguées. C'est une vraie démonstration que l'évaluation est plus facile que la génération, la même asymétrie que la couverture harnais de ce mois-ci n'a cessé d'encercler sous d'autres angles — un jour après que Z.ai a rapporté un bond tout aussi surprenant dans une capacité voisine liée à l'auto-évaluation.
Apprentissage continu à l'intérieur d'ARC-AGI-3, et en dehors de sa distribution d'entraînement
Séparément du résultat de l'OIM, l'équipe a validé la formation de mémoire au moment du test en utilisant ARC-AGI-3 — le même benchmark à horizon ultra-long vers lequel les articles harnais de ce mois-ci ne cessent de revenir — où les tâches courent sur des milliers d'interactions pendant 40 à 50 heures et où le succès exige d'apprendre les règles de l'environnement sans connaissance préalable, à la manière dont un humain explorerait un jeu inconnu. dots3-note Preview formerait des hypothèses, les testerait par interaction, corrigerait la mémoire périmée quand une hypothèse échoue, et porterait la mémoire de travail vers les décisions ultérieures. L'affirmation notable : cela se généraliserait à des environnements sur lesquels le modèle n'a jamais été entraîné, démontré avec une version publique tournant en continu contre Slay the Spire 2. Si cela résiste à l'examen, c'est la preuve d'une stratégie d'exploration réellement transférable plutôt qu'un comportement mémorisé pour une seule famille de benchmarks.
Les graphiques de benchmarks, lus avec attention
À travers deux grilles comparatives denses — Personal Assistant Agent, Coding & Computer Use, Information Retrieval et Complex Reasoning dans l'une ; perception multimodale dans l'autre — dots3-note Preview est mesuré face à Hy3 (295B/21B), GLM 5.2 (743B/39B), DeepSeek-V4-Flash-0731 (284B/13B), Kimi K3 (2,8T/104B), Claude Opus 4.8, et GPT-5.5. Le propre cadrage de l'équipe est fidèle à ce que montrent les graphiques : dots3-note Preview est compétitif avec, et sur plusieurs benchmarks devant, des modèles plusieurs fois plus grands que lui — un modèle de 280B/16B rivalisant avec un concurrent de 2,8T au total est un résultat d'efficacité réellement notable, dans la même veine que la couverture des petits modèles de ce mois-ci. Il ne mène pas tout — la frontière fermée (Opus 4.8, GPT-5.5) et le plus grand modèle présenté (Kimi K3) gagnent encore les catégories de raisonnement les plus dures — mais « plusieurs fois sa taille » n'est pas ici une exagération marketing.
Deux nouveaux benchmarks qui méritent d'être notés en eux-mêmes
La sortie inclut des environnements d'évaluation open source, pas seulement un modèle : VibeSearchBench (200 tâches, 20 domaines, recherche multi-tours où l'intention est révélée progressivement par un simulateur piloté par persona, noté par appariement de triplets de graphe de connaissances) et VibeLifeBench (20 tâches, 10 domaines, chacune s'étalant sur 20 à 30 étapes avec 1 247 vérifications atomiques de cohérence inter-étapes, d'exécution d'outils et de livrables finaux — le genre de tâche longue et changeante à laquelle un vrai assistant personnel serait réellement confronté). Les deux visent l'écart entre les environnements RL fermés et vérifiables et la vie réelle ambiguë, et les deux sont utilisables par quiconque essaie de reproduire ou de contester les résultats — une vraie contribution à l'écosystème d'évaluation partagé, pas seulement une sortie de modèle.
La section limitations mérite un vrai crédit
L'équipe énonce clairement : « Le renforcement par apprentissage n'est pas encore terminé », avec des limitations nommées dans l'atténuation des hallucinations, l'équilibre entre capacités textuelles et multimodales, et la stabilité globale. Elle est tout aussi directe sur le fait que les démonstrations de tâches réelles — coordination de mariage, opérations de e-commerce café, conciergerie de voyage — tournent dans des environnements simulés uniquement, et que transformer la capacité en quelque chose de fiable « exige non seulement un modèle de fondation, mais aussi des harnais robustes, des connecteurs, des sources de données, des mécanismes de sécurité et de permission, et une conception produit. Ce travail est en cours. » C'est le même standard de divulgation crédité ailleurs ce mois-ci — énoncer la limite réelle d'une capacité plutôt que de laisser un résultat phare fort sous-entendre plus qu'il ne prouve.
À surveiller
- Le rapport technique attendu dans la semaine, spécifiquement pour savoir comment la configuration gagnante de l'OIM se rapporte au checkpoint publié — détails du harnais, si ce sont les mêmes poids, et reproductibilité.
- La vérification indépendante des affirmations de benchmarks ajustées à la taille, en particulier face à Kimi K3 et à la frontière fermée, maintenant que les poids sont réellement téléchargeables.
- Si jazz et aria — les plus grands frères de la famille dots3 — suivent, et selon quel calendrier. Une famille crédible à trois paliers, pas seulement une seule préversion légère, est le test qui dira si Xiaohongshu construit un programme de modèles durable ou une vitrine de recherche ponctuelle.
Références : Annonce dots3-note · dots-studio/dots3-note-prev sur Hugging Face · GitHub — studio-dots-ai/dots3-note-prev · fil d'annonce sur X · couverture liée : GLM-5.3 · Comprendre ARC-AGI · Nemotron 3.5 Lightning · Les poids ouverts de Qwen3.8-Max atterrissent · Frontier Arcade : tendances et prédictions