Inherent Laboratories a publié un article sur Faraday, un agent « Scientifique IA » de 27 milliards de paramètres entraîné à répliquer des résultats issus d'articles publiés de machine learning et d'IA pour la science — reproduisant une figure d'un article dont le résultat a été caviardé, avec un budget de 60 minutes et une seule tranche de GPU H200, sans voir le graphique original. Le constat phare : Faraday, post-entraîné sur cette tâche, bat à la fois Claude Opus 4.8 et GPT-5.5 (Codex) selon le propre juge de l'article — y compris sur des sujets d'articles sur lesquels il n'a jamais été entraîné. Le détail d'ingénierie le plus intéressant se trouve sous ce constat phare : Faraday est un modèle de 27 milliards de paramètres qui fonctionne en dirigeant Codex GPT-5.5 — un agent que l'article estime à environ 5 000 milliards de paramètres — en tant qu'outil, et il surpasse les propres tentatives autonomes de ce modèle bien plus grand sur la même tâche.
Pourquoi la réplication est une cible d'entraînement plus difficile qu'il n'y paraît
La réplication d'articles n'a pas de réponse unique et correcte à laquelle se comparer. Un article compresse la recherche qui l'a produit, donc un agent qui le réplique doit inférer les détails manquants, décider quoi réduire en échelle sous des contraintes de temps et de calcul, et juger si une version réduite teste toujours réellement l'affirmation de l'article — plus proche d'une recherche ouverte que d'une tâche avec un signal de réussite/échec vérifiable. C'est précisément le problème que l'article résout : la plupart des dispositifs d'entraînement existants pour « Scientifiques IA » ont soit besoin d'une fonction de récompense fixe qui ne fonctionne que pour des problèmes avec une métrique escaladable, soit se rabattent sur un jugement LLM entièrement ouvert (plus proche de la relecture par les pairs) qui est bruité et difficile à valider.
L'espace de tâches : 310 tâches de réplication auto-générées à partir de 100 vrais articles
Le benchmark de l'article, appelé Replica, est construit à partir de 100 articles connus de ML et d'IA pour la science publiés entre 1990 et 2026, donnant 310 tâches (242 pour l'entraînement, 68 retenues pour le test) — une tâche par figure de résultats, générée automatiquement en utilisant Gemini 2.5 Pro pour localiser et caviarder chaque figure du PDF de l'article, puis vérifiée à la main pour filtrer les figures mal caviardées ou mal identifiées. Chaque tâche remet à l'agent l'article avec une figure retirée, une limite de 60 minutes, et une seule tranche MIG d'un septième d'un GPU H200 — explicitement pas assez pour faire tourner l'expérience originale à son échelle d'origine pour la plupart des articles, ce qui force l'agent à décider à quoi ressemble réellement une version fidèle et réduite de l'expérience plutôt que de simplement faire tourner une version plus petite à l'aveugle.
Le problème de la récompense : un juge à rubrique, et un rapport honnête sur son efficacité
Comme il n'existe pas de signal de réussite/échec de référence pour une réplication, l'article entraîne une grille de notation propre à chaque tâche (générée par Claude Opus 4.7, sans voir la vraie figure, afin qu'elle note l'affirmation sous-jacente plutôt que des détails cosmétiques du graphique) et note les déroulements avec un juge basé sur Codex par rapport à cette grille. L'article est inhabituellement direct en testant ce juge face à de vrais chercheurs humains plutôt que de supposer qu'il fonctionne : dans une étude de validation avec des évaluateurs de niveau doctorat, le juge à rubrique s'accordait avec les classements humains à une corrélation de Kendall de 0,19, contre 0,15 pour un juge de référence plus simple à prompt constant. Cela mérite d'être pris tel quel plutôt qu'arrondi vers le haut : 0,19 est un avantage réel mais modeste, et il vaut aussi la peine de noter que les deux évaluateurs humains de cette étude ne s'accordaient entre eux qu'à 0,30 — ce qui signifie que la tâche elle-même est bruitée même pour des humains, et que le juge est validé contre une cible authentiquement difficile à cerner, pas contre un étalon-or propre. Là où le juge à rubrique montre un avantage plus net, c'est sur l'auto-cohérence : deux tirages indépendants du juge à rubrique s'accordaient entre eux à 0,66, bien au-dessus des 0,30 de deux évaluateurs humains indépendants — ce qui est la vraie base sur laquelle l'article l'utilise comme signal de récompense RL à faible variance, plutôt qu'une affirmation qu'il raisonne comme le ferait un évaluateur humain.
Le résultat, compté directement : Faraday gagne la plupart du temps, pas tout le temps
Faraday — Qwen3.6-27B, affiné par LoRA avec une variante de GRPO à attribution de crédit par tour sur l'ensemble d'entraînement de Replica — surpasse à la fois Claude Opus 4.8 et Codex GPT-5.5 sur 73 % des tâches ML en distribution et 60 % des tâches d'IA pour la science retenues, selon le propre juge de l'article, avec des améliorations de score moyennes de 6 % par rapport à Claude et 8 % par rapport à Codex sur l'ensemble de test. L'article a aussi testé si le seul prompting pouvait combler cet écart : 24 générations d'optimisation automatique de prompt sur la référence Codex (Claude Opus 4.7 réécrivant le prompt à partir des retours de déroulements à chaque génération) ont laissé le score de Codex essentiellement inchangé, ce qui signifie que l'écart ne venait pas d'une faiblesse de prompt corrigible. Sur le plan qualitatif, les exemples propres à l'article, examinés à la main, sont précis et vérifiables en esprit même si les déroulements sous-jacents ne sont pas publics : sur une tâche de réplication de Voyager, le meilleur déroulement de Claude aurait fourni une bibliothèque de compétences pré-remplie au lieu de faire tourner le processus d'acquisition de compétences que la figure était censée tester, tandis que Faraday a fait tourner le vrai processus d'acquisition-et-transfert que l'article décrit — une vraie distinction qualitative entre démontrer une sortie et reproduire le mécanisme, si l'exemple rapporté se confirme.
Là où l'article prend soin de ne pas surinterpréter
Deux des tests de suivi de l'article lui-même méritent d'être lus comme délibérément modestes plutôt que comme des confirmations. D'abord, une étude de préférence humaine : les chercheurs ont sélectionné 41 déroulements spécifiquement parmi les cas où le juge à rubrique disait que Faraday détenait un net avantage, et ont demandé à des humains de comparer — les humains ont préféré Faraday aux deux références dans 29 cas sur 41. L'article déclare explicitement que ce dispositif « ne permet pas de tirer de conclusions quant à savoir si les humains préfèrent Faraday à Claude et Codex en moyenne », puisque l'échantillon a été sélectionné pour des cas favorisant Faraday plutôt que tiré au hasard — une réserve qui mérite d'être prise au pied de la lettre plutôt que de lire le chiffre de 29/41 comme un taux de préférence général. Ensuite, un test de généralisation sur huit articles nécessitant des budgets de calcul plus importants (jusqu'à huit heures et huit GPU B300) : Faraday a battu Claude sur cinq des huit, ce que les auteurs qualifient de suggestif d'une généralisation tout en notant explicitement qu'une affirmation plus claire nécessiterait que le juge à rubrique soit validé séparément à cette échelle plus grande, puisqu'il a été construit et vérifié sur la distribution de tâches à budget plus restreint. L'article a aussi sollicité directement les retours des propres auteurs de quatre articles répliqués, et a rapporté les résultats mitigés sans détour plutôt que seulement les éloges — citant de vraies critiques aux côtés des remarques positives, dont le fait que la qualité de rédaction et le style de code de Faraday laissaient parfois à désirer même là où la réplication sous-jacente était solide.
Ce que cela prouve, et ce que cela ne prouve pas
C'est un préprint d'un laboratoire industriel (Inherent Laboratories), soumis le 13 août 2026 — pas encore relu par les pairs, évalué contre un benchmark et un juge construits par la même équipe, et pas encore reproduit de façon indépendante en dehors de l'article. Cette combinaison ne rend pas le résultat faux, mais elle mérite d'être nommée clairement plutôt que de traiter la comparaison auto-jugée d'une entreprise sur son propre modèle comme équivalente à une validation tierce. Ce que l'article étaye bien, à ses propres conditions, c'est l'affirmation structurelle : un modèle de 27 milliards de paramètres, post-entraîné spécifiquement pour décider quoi étudier et comment cadrer une expérience, peut diriger un agent de codage généraliste bien plus grand vers de meilleurs résultats que ceux que cet agent atteint seul — sans que personne n'ait besoin de concevoir à la main un harnais multi-agent spécialisé pour la tâche.
À surveiller
- Une reproduction indépendante de la comparaison phare. Le juge à rubrique et l'ensemble de tâches Replica sont la propre construction de l'article ; qu'un tiers relance la même comparaison, ou construise un juge indépendant, est ce qui trancherait si les taux de victoire de 73 %/60 % tiennent.
- Le juge à rubrique validé à plus grande échelle de calcul. Les auteurs signalent eux-mêmes cet écart — le test de généralisation à huit articles a utilisé un juge qui n'a été vérifié que face au budget de tâche par défaut, plus restreint.
- Si le motif « agent de codage en tant qu'outil » apparaît ailleurs. Le propre cadrage de l'article — un modèle plus petit, post-entraîné, dirigeant un modèle de pointe bien plus grand en tant qu'outil, et battant les tentatives non assistées de ce modèle plus grand — est une affirmation architecturale distincte et testable, indépendante du benchmark de réplication lui-même.
Références : arXiv — Training AI Scientists to Replicate Research (2608.13331) · Inherent Laboratories — Training to Replicate · Inherent (@inherent_labs) sur X — fil d'annonce · couverture liée : Frontier Arcade : tendances et prédictions