2026-08-16

Prime Intellect a lancé 153 sessions de recherche autonome en IA. Les modèles n'ont trouvé aucune idée neuve — et se sont pourtant nettement hiérarchisés

AIBenchmarksInfrastructure🌍 Global

Prime Intellect a lancé 153 sessions autonomes réparties sur 18 modèles de pointe sur le speedrun d'optimiseur nanoGPT — un véritable test de la capacité des modèles à mener une recherche originale, et pas seulement à dérouler une recette connue. Chaque session recevait un même script d'entraînement de 124 M de paramètres, un règlement, une consigne unique, un nœud GPU 8xH200 et jusqu'à huit jours de temps réel, sans aucun accès à internet. L'objectif : battre une référence réglée par des humains à 3 290 pas d'entraînement (validée selon le critère statistique de Prime Intellect ; la version du classement public est à 3 250), en visant le record humain public de 2 600, et en ne touchant qu'aux hyperparamètres liés à l'optimiseur. L'expérience tranche une question restée ouverte lorsque le harnais Prime Agent avait dépassé la barre humaine sur ARC-AGI-3 d'un cheveu, 0,1 point : ce gain se généralise-t-il au-delà d'un seul benchmark ? Il se généralise — mais ce que l'expérience met au jour en chemin est plus intéressant que le classement lui-même.

L'échelle, pour contexte

L'expérience est nettement plus vaste que tout ce qui a été publié de comparable jusqu'ici. L'évaluation interne d'Anthropic sur la R&D en IA automatisée optimise sur un nœud CPU ; la fiche système de GPT-5.6 Sol, chez OpenAI, rend compte de nanoGPT Track 1 sur un seul H100 pendant moins d'une journée ; METR a fait tourner six agents sur un speedrun plafonné à cinq jours et 10 000 $ chacun ; le NanoGPT-Bench d'Intology accorde aux agents environ 2,7 jours sur un nœud 8xH100 et constate qu'ils ne rattrapent pas 10 % de cinq mois de progrès humain. Les sessions de Prime Intellect, elles, sont allées jusqu'à huit jours sur des 8xH200, sur 18 modèles, avec plusieurs graines aléatoires par modèle — et tout a été publié : traces, brouillons, flux de raisonnement des modèles à poids ouverts, rapports de surveillance horaires, et le harnais lui-même.

Le résultat phare, et la vérification à budget égal qui le rend crédible

Fable 5 a comblé 81,7 % de l'écart avec le record humain, en descendant à 2 726 pas — nettement en tête, et avec une large marge. Opus 5 et Kimi K3 suivent, autour de 52 à 54 %. Le reste du peloton — GPT-5.6 Sol, Grok 4.5, GLM 5.2, DeepSeek V4 Pro, Qwen3.8 Max, Muse Spark, Kimi K2.7 — se regroupe bien en dessous des 40 %. Ce qui hisse ce résultat au-dessus du simple classement brut, c'est la comparaison à budget égal menée par Prime Intellect : en accordant à la meilleure session de chaque modèle un budget strictement identique — en heures d'agent, en nombre d'expériences ou en tokens produits —, le classement bouge à peine. Fable 5 et Opus 5 restent en tête selon les trois modes de comptage. L'objection la plus facile tombe donc d'elle-même : les meilleurs modèles n'ont pas simplement consommé plus de calcul ; l'écart tient à ce qu'ils font d'un budget donné, non à la taille de ce budget.

Le constat le plus important, bien avant le classement : personne n'a rien inventé

Prime Intellect l'affirme clairement au lieu de l'enfouir : aucune des 153 sessions n'a produit de méthode d'optimisation fondamentalement neuve. Les ingrédients gagnants — un meilleur préconditionnement, des bornes hautes et basses sur l'amplitude des poids et des mises à jour, des calendriers de taux d'apprentissage maintenus élevés plus longtemps, un moyennage des poids en fin d'entraînement — figurent tous déjà dans la littérature. Tous les modèles, les bons comme les faibles, ont convergé vers à peu près le même espace d'idées. L'écart entre les paliers tient donc entièrement à la conduite de la recherche, et non à la production d'idées : quelles expériences mener en priorité, avec quelle rigueur, et comment interpréter un résultat bruité. Le constat est franchement gênant pour qui voit dans les annonces de « recherche autonome par IA » la preuve d'une capacité de découverte émergente : les modèles font ici la démonstration d'un vrai savoir-faire d'exécution sans la moindre créativité scientifique. Et le rapport a l'honnêteté de reconnaître qu'il ne peut pas dire s'il s'agit d'une particularité de ce speedrun ou d'un authentique plafond de capacité.

Ce qui sépare vraiment les paliers : mesurer son bruit, et rouvrir ses échecs

La preuve la plus nette d'un vrai savoir-faire de chercheur tient à un détail que Prime Intellect avait délibérément faussé : l'estimation du bruit fournie à chaque modèle dans le règlement était volontairement un peu surévaluée. Soixante-deux des quelque cent sessions ont mesuré elles-mêmes le bruit réel au lieu de se fier au chiffre annoncé — et ce sont précisément celles-là qui se retrouvent en haut du tableau. Quarante-deux sont allées plus loin et ont découvert d'elles-mêmes que relancer la recette à l'identique sur la même graine aléatoire fait malgré tout varier la perte : un non-déterminisme propre au GPU, plus faible que la variation d'une graine à l'autre, mais bien réel. Plusieurs modèles ont alors refondu tout leur protocole de sélection pour comparer les recettes sur une graine commune, et trancher ainsi des écarts qu'une présélection ordinaire n'aurait pas pu détecter à coût de calcul égal. Personne ne leur avait signalé l'existence de ce phénomène.

Le deuxième facteur de différenciation, c'est le traitement des résultats négatifs. Les modèles les plus faibles ont écarté des familles d'idées entières sur la foi d'une seule graine bruitée, pris leurs propres plantages pour la preuve qu'une idée était mauvaise, et jeté de petits gains qui ne franchissaient pas isolément le seuil de signification. Grok 4.5 a ainsi abandonné deux fois la normalisation par ligne à cause de ses propres erreurs de mise à l'échelle : un échec précis et identifiable, qui consiste à imputer à la méthode ce qui relève d'un bug d'implémentation. Les meilleurs ont fait exactement l'inverse : vérifier les résultats limites sur trois graines avant d'en engager huit, refaire une ablation complète après chaque intégration pour repérer les idées devenues inutiles, et rouvrir explicitement d'anciens résultats négatifs après chaque modification de la recette, au motif que ce qui était resté sans effet pouvait désormais compter. Opus 5 a repris le réglage de β2 sous une nouvelle recette, et en a tiré un nouveau record. Kimi K3 a supprimé deux mécanismes pourtant à l'origine de son propre record précédent, une fois qu'une nouvelle normalisation les avait rendus superflus. Voilà la compétence réellement mesurée ici : non pas « avoir plus d'idées », mais savoir lesquels de ses résultats négatifs valent encore une fois que le terrain a bougé.

Le noyau persistant de Prime Agent a permis aux modèles de construire leurs propres outils

Plusieurs sessions ont utilisé Prime Agent, le harnais maison de Prime Intellect : un noyau IPython persistant pour seul outil, selon la conception de Recursive Language Model que j'avais couverte à sa sortie. Kimi K3 s'est écrit ses propres fonctions pour produire des variantes d'optimiseur contrôlées, lancer des essais, comparer des courbes de perte et restaurer une référence propre. Plus tard dans la même session, il s'est monté un banc d'essai numérique distinct afin de réajuster à moindres frais les coefficients de Newton-Schulz sur CPU, avant de dépenser une session GPU à les éprouver — puis il a révisé son hypothèse lorsque la mise à jour théoriquement plus propre s'est révélée moins bonne à l'entraînement réel. DeepSeek V4 Pro 0813 a procédé de façon comparable : présélectionner des récursions PSGD candidates dans une simulation de covariance synthétique, au fil de plusieurs révisions décidées seul, avant de juger qu'une session complète valait le calcul qu'elle coûtait. On est là très loin d'un simple « le harnais améliore le score du modèle » : c'est un modèle qui se sert d'un outil généraliste pour se construire, en cours de tâche et sans qu'on le lui demande, sa propre infrastructure de recherche.

Le dispositif anti-triche mérite d'être nommé

Pour revendiquer un record, il faut une session sur huit graines dont la moyenne descend à 3,27859 contre une barre fixée à 3,28 — une marge qui ramène la probabilité de réussir par pure chance à une sur mille environ. Chaque session est isolée en bac à sable (bwrap et un espace de noms réseau dédié), la seule sortie vers l'extérieur étant un proxy de journalisation qui n'autorise que l'API du modèle lui-même. Aucun accès général à internet, et c'est délibéré : des expériences antérieures avaient montré que les modèles devenaient moins créatifs dès qu'ils pouvaient aller chercher des correctifs existants à imiter plutôt que de redériver eux-mêmes les méthodes. Un modèle superviseur indépendant a audité chaque session toutes les heures ; après des centaines de rapports sans la moindre tricherie ni évasion du bac à sable, Prime Intellect a cessé de le faire tourner en continu. Un point mérite d'être signalé clairement : plusieurs modèles du tableau — Qwen3.8 Max, DeepSeek V4 Pro, Grok 4.6, Muse Spark 1.2, GLM 5.3 — étaient encore marqués « RUNNING » ou sans record final au moment de la publication. Leurs positions actuelles sont donc provisoires, et non un classement définitif.

À surveiller

  • Les chiffres définitifs des modèles encore en cours d'exécution. Grok 4.6, GLM 5.3 et quelques autres étaient incomplets à la publication : leur place dans la hiérarchie n'est pas encore arrêtée.
  • Le constat « aucune idée neuve » se reproduira-t-il sur une autre tâche de recherche ? Il ne s'agit ici que d'un seul speedrun, doté d'un signal de récompense parfaitement clair. Savoir si le schéma « l'exécution l'emporte sur la créativité » tient encore sur un problème de recherche moins balisé, voilà le vrai test de ce qui est mesuré.
  • Les suites prévues avec un accès partiel à internet. Prime Intellect l'annonce explicitement comme prochaine étape, après avoir constaté que l'absence totale d'accès produisait des résultats plus créatifs — sinon plus novateurs — que des sessions antérieures où la recherche sur arXiv était autorisée. Une hypothèse à vérifier directement plutôt qu'à tenir pour acquise.

À lire ensuite