2026-08-16

Prime Intellect a lancé 153 runs autonomes de recherche en IA. Les modèles n'ont trouvé aucune idée nouvelle — et se sont quand même répartis en paliers nets

AIBenchmarksInfrastructure🌍 Global

Prime Intellect a lancé 153 runs autonomes sur 18 modèles de pointe sur le speedrun d'optimiseur nanoGPT — un vrai test de la capacité des modèles à mener une recherche authentique, pas seulement à appliquer une recette connue. Chaque run recevait un script d'entraînement partagé de 124M de paramètres, un règlement, un seul message, un nœud GPU 8xH200, et jusqu'à huit jours de temps réel, sans aucun accès à internet. La tâche : battre une référence réglée par des humains de 3 290 pas d'entraînement (vérifiée selon la propre barre statistique de Prime Intellect ; la version du classement public est 3 250) en direction d'un record humain public de 2 600, en ne changeant que les hyperparamètres liés à l'optimiseur. Cela répond directement à une question laissée en suspens quand le harnais Prime Agent de Prime Intellect avait franchi la ligne humaine sur ARC-AGI-3 par une coïncidence de 0,1 point : si le gain se généralise au-delà d'un seul benchmark. C'est le cas — et ce que l'expérience révèle en chemin est plus intéressant que le classement lui-même.

L'échelle, pour contexte

C'est une expérience nettement plus vaste que tout ce qui a été publié de comparable jusqu'ici : l'évaluation interne de R&D IA automatisée d'Anthropic optimise sur un nœud CPU ; la fiche système de GPT-5.6 Sol d'OpenAI rapporte nanoGPT Track 1 sur un seul H100 pendant moins d'une journée ; METR a fait tourner six agents sur un speedrun en temps réel plafonné à cinq jours et 10 000 $ chacun ; le NanoGPT-Bench d'Intology donne aux agents environ 2,7 jours sur un nœud 8xH100 et constate qu'ils récupèrent moins de 10 % de cinq mois de progrès humain. Les runs de Prime Intellect sont allés jusqu'à huit jours sur des 8xH200, sur 18 modèles, avec plusieurs graines par modèle — et tout a été publié : traces, brouillons, flux de raisonnement pour les modèles à poids ouverts, rapports de surveillance horaires, et le harnais lui-même.

Le résultat phare, et la vérification à budget égal qui le rend crédible

Fable 5 a comblé 81,7 % de l'écart au record humain, atteignant 2 726 pas — le leader net, avec une large marge. Opus 5 et Kimi K3 suivent à environ 52-54 %. Le reste du peloton — GPT-5.6 Sol, Grok 4.5, GLM 5.2, DeepSeek V4 Pro, Qwen3.8 Max, Muse Spark, Kimi K2.7 — se regroupe nettement sous les 40 %. Ce qui fait que ceci dépasse un simple artefact de classement brut, c'est la comparaison à budget égal de Prime Intellect : donner à chaque meilleur run de chaque modèle un budget fixe identique, en heures d'agent, en nombre d'expériences, ou en tokens de sortie, ne change presque pas le classement. Fable 5 et Opus 5 mènent sous les trois cadrages. Cela écarte l'objection facile selon laquelle les meilleurs modèles auraient simplement brûlé plus de calcul — l'écart réside dans ce qu'ils ont fait avec un budget donné, pas dans la taille du budget.

La découverte la plus importante, plus que le classement lui-même : personne n'a rien trouvé de nouveau

Prime Intellect l'énonce clairement plutôt que de l'enfouir : aucun des 153 runs n'a produit une méthode d'optimisation fondamentalement nouvelle. Les ingrédients gagnants — meilleur préconditionnement, plafonds et planchers sur les magnitudes de poids/mise à jour, calendriers de taux d'apprentissage maintenus chauds plus longtemps, moyennage de poids en fin d'entraînement — sont tous des techniques déjà présentes dans la littérature. Chaque modèle, fort ou faible, a convergé à peu près vers le même espace d'idées. Tout l'écart entre paliers venait du processus de recherche, pas de la génération d'idées : quelles expériences prioriser, avec quelle rigueur les mener, et comment interpréter un résultat bruité. C'est une découverte réellement inconfortable pour quiconque traite les affirmations de « recherche IA autonome » comme preuve d'une découverte novatrice émergente — les modèles ici démontrent une compétence d'exécution de la recherche sans créativité de recherche, et le rapport est honnête sur le fait qu'il ne peut pas dire si c'est une propriété de ce speedrun spécifique ou un vrai plafond de capacité.

Ce qui a vraiment séparé les paliers : la modélisation du bruit et le retour sur d'anciens échecs

La preuve la plus claire d'une vraie compétence de recherche est un détail que Prime Intellect a délibérément retenu : l'estimation de bruit donnée à chaque modèle dans le règlement était volontairement légèrement trop grande. 62 des quelque 100 runs ont mesuré eux-mêmes le bruit réel plutôt que de faire confiance au chiffre indiqué, et ces runs se regroupent en haut du tableau de résultats. 42 sont allés plus loin et ont découvert, sans y être invités, que relancer la recette identique sur la graine identique fait quand même bouger la perte — un non-déterminisme GPU, plus petit que le bruit de graine à graine mais réel — et plusieurs modèles ont reconstruit tout leur protocole de sélection autour de la comparaison de recettes sur une graine partagée pour résoudre des différences qu'un dépistage normal n'aurait pas pu détecter pour le même coût de calcul. Personne ne leur avait dit que cela existait.

Le second facteur de différenciation est la façon dont les modèles ont traité les résultats négatifs. Les modèles plus faibles ont éliminé des familles d'idées entières sur une seule graine bruitée, ont traité leurs propres plantages comme preuve qu'une idée était mauvaise, et ont jeté de petits gains qui ne franchissaient pas individuellement le seuil de signification. Grok 4.5 a perdu la normalisation par ligne à deux reprises à cause de ses propres bugs d'échelle — un échec spécifique et attribuable consistant à blâmer la méthode pour un bug d'implémentation. Les modèles les plus forts ont fait l'inverse : tester les résultats limites sur trois graines avant de s'engager sur huit, ré-ablater toute la pile après chaque fusion pour repérer les idées qui avaient cessé d'aider, et revisiter explicitement d'anciens résultats négatifs une fois la recette modifiée, sur le raisonnement que quelque chose d'inerte auparavant pourrait maintenant compter. Opus 5 a rouvert le réglage de β2 sous une nouvelle recette et cela est devenu un nouveau record. Kimi K3 a supprimé deux mécanismes qui avaient produit son propre record précédent, une fois qu'une nouvelle normalisation les a rendus redondants. C'est la vraie compétence mesurée ici — pas « plus d'idées », mais savoir quels résultats négatifs s'appliquent encore une fois que le terrain a changé.

Le noyau persistant de Prime Agent a permis aux modèles de construire leurs propres outils

Plusieurs runs ont utilisé Prime Agent, le propre harnais de Prime Intellect — un noyau IPython persistant comme seul outil du modèle, le même design de Recursive Language Model que nous avions couvert à sa sortie. Kimi K3 a construit ses propres fonctions pour créer des variantes d'optimiseur contrôlées, lancer des runs, comparer des courbes de perte, et restaurer une référence propre — puis, plus tard dans la même session persistante, a construit un laboratoire numérique séparé pour réajuster les coefficients de Newton-Schulz à moindre coût sur CPU avant de dépenser un run GPU pour les tester, et a révisé son hypothèse quand la mise à jour théoriquement plus propre a perdu en entraînement réel. DeepSeek V4 Pro 0813 a fait quelque chose de similaire : sélectionner des récursions PSGD candidates dans une simulation de covariance synthétique à travers plusieurs révisions auto-dirigées avant de décider qu'un run complet valait le calcul. C'est un comportement réellement différent de « le harnais rend le modèle meilleur sur le benchmark » — c'est le modèle utilisant un outil généraliste pour construire sa propre infrastructure de recherche en cours de tâche, sans y être invité.

Le dispositif anti-triche mérite d'être nommé

Revendiquer un record exige un run à huit graines battant une moyenne de 3,278 59 face à la barre de 3,28 — une marge qui rend la réussite par pure chance environ une fois sur mille. Chaque run est isolé en bac à sable (bwrap plus un espace de noms réseau), la seule sortie vers l'extérieur étant un proxy de journalisation qui n'autorise que la propre API du modèle et rien d'autre — aucun accès internet général, délibérément, après que des expériences antérieures ont montré que les modèles devenaient moins créatifs quand ils pouvaient chercher des PR existantes à imiter plutôt que de dériver eux-mêmes des méthodes. Un moniteur LLM indépendant a audité chaque run toutes les heures ; après des centaines de rapports sans tricherie ni évasion de bac à sable détectées, Prime Intellect a arrêté de le faire tourner en continu. À signaler clairement : certains modèles du tableau de résultats — Qwen3.8 Max, DeepSeek V4 Pro, Grok 4.6, Muse Spark 1.2, GLM 5.3 — sont marqués « RUNNING » ou n'affichent aucun record final au moment de la publication, donc leurs positions actuelles sont à traiter comme provisoires, pas comme un classement final.

À surveiller

  • Les chiffres finaux des modèles encore « en cours ». Grok 4.6, GLM 5.3, et d'autres étaient incomplets au moment de la publication — le classement actuel par palier pour ces modèles spécifiques n'est pas encore arrêté.
  • Si la découverte « aucune idée nouvelle » se reproduit sur une autre tâche de recherche. Ceci est un seul speedrun avec un seul signal de récompense clair ; si le même motif « l'exécution bat la créativité » se maintient sur un problème de recherche moins balisé est le vrai test de ce qui est réellement mesuré ici.
  • Les suites avec accès internet partiel. Prime Intellect signale explicitement cela comme une prochaine étape prévue, ayant constaté qu'un accès internet nul produisait des résultats plus créatifs (sinon plus novateurs) que des runs antérieurs avec recherche arXiv activée — à tester directement plutôt qu'à supposer.

Références : Prime Intellect — Measuring Autonomous Research · Prime Intellect — résultats NanoGPT Speedrun Frontier · @PrimeIntellect sur X — annonce · PrimeIntellect-ai/prime-agent · couverture liée : Prime Agent dépasse la ligne humaine de 0,1 point · Deux harnais résolvent le même benchmark en s'opposant sur la mémoire · Frontier Arcade : tendances et prédictions