2026-08-22

Faraday est un modèle de 27 milliards de paramètres qui dirige un agent de codage à ~5 000 milliards — et le bat à la réplication d'articles

AIScienceBenchmarks🌍 Global

Inherent Laboratories a publié un article sur Faraday, un agent « Scientifique IA » de 27 milliards de paramètres entraîné à répliquer des résultats issus d'articles publiés de machine learning et d'IA pour la science. La tâche : reproduire une figure de résultats d'un article dont le résultat a été caviardé, avec un budget de 60 minutes et une seule tranche de GPU H200, sans jamais voir le graphique original. Le constat phare : Faraday, post-entraîné sur cette tâche, bat à la fois Claude Opus 4.8 et GPT-5.5 (Codex) selon le propre juge de l'article — y compris sur des sujets d'articles sur lesquels il n'a jamais été entraîné. Le détail d'ingénierie le plus intéressant se trouve sous ce constat phare. Faraday est un modèle de 27 milliards de paramètres qui fonctionne en dirigeant Codex GPT-5.5 — un agent que l'article estime à environ 5 000 milliards de paramètres — en tant qu'outil, et il surpasse les propres tentatives autonomes de ce modèle bien plus grand sur la même tâche.

Pourquoi la réplication est une cible d'entraînement plus difficile qu'il n'y paraît

La réplication d'articles n'a pas de réponse unique et correcte à laquelle se comparer. Un article compresse la recherche qui l'a produit, donc un agent qui le réplique doit inférer les détails manquants, décider ce qu'il faut réduire sous des contraintes de temps et de calcul, et juger si une version réduite teste toujours réellement l'affirmation de l'article. C'est plus proche d'une recherche ouverte que d'une tâche avec un signal de réussite/échec vérifiable. C'est précisément le problème que l'article résout : la plupart des dispositifs d'entraînement existants pour « Scientifiques IA » ont soit besoin d'une fonction de récompense fixe qui ne fonctionne que pour des problèmes dotés d'une métrique automatisable, soit se rabattent sur un jugement LLM entièrement ouvert (plus proche de la relecture par les pairs) qui est bruité et difficile à valider.

L'espace de tâches : 310 tâches de réplication auto-générées à partir de 100 vrais articles

Le benchmark de l'article, appelé Replica, est construit à partir de 100 articles connus de ML et d'IA pour la science publiés entre 1990 et 2026, donnant 310 tâches (242 pour l'entraînement, 68 retenues pour le test). Chaque tâche correspond à une figure de résultats, générée automatiquement en utilisant Gemini 2.5 Pro pour localiser et caviarder cette figure du PDF de l'article, puis vérifiée à la main pour filtrer les figures mal caviardées ou mal identifiées. L'agent reçoit l'article avec une figure retirée, une limite de 60 minutes, et une seule tranche MIG d'un septième d'un GPU H200. Pour la plupart des articles, c'est explicitement insuffisant pour faire tourner l'expérience originale à son échelle d'origine, ce qui force l'agent à décider à quoi ressemble réellement une version fidèle et réduite de l'expérience plutôt que de simplement faire tourner une version plus petite à l'aveugle.

Le problème de la récompense : un juge sur grille, et un rapport honnête sur son efficacité

Comme il n'existe pas de signal de réussite/échec de référence pour une réplication, l'article entraîne une grille de notation propre à chaque tâche et note les trajectoires avec un juge basé sur Codex par rapport à cette grille. La grille est générée par Claude Opus 4.7 sans voir la vraie figure, afin qu'elle note l'affirmation sous-jacente plutôt que des détails cosmétiques du graphique. L'article est inhabituellement direct en testant ce juge face à de vrais chercheurs humains plutôt que de supposer qu'il fonctionne : dans une étude de validation avec des évaluateurs de niveau doctorat, le juge sur grille s'accordait avec les classements humains à une corrélation de Kendall de 0,19, contre 0,15 pour un juge de référence plus simple à prompt constant. Ce 0,19 est un avantage réel mais modeste, à prendre tel quel plutôt qu'à arrondir vers le haut. Il vaut aussi la peine de noter que les deux évaluateurs humains de cette étude ne s'accordaient entre eux qu'à 0,30 — la tâche elle-même est bruitée même pour des humains, donc le juge est validé contre une cible authentiquement difficile à cerner, pas contre un étalon-or propre. Là où le juge sur grille montre un avantage plus net, c'est sur l'auto-cohérence : deux tirages indépendants du juge sur grille s'accordaient entre eux à 0,66, bien au-dessus des 0,30 de deux évaluateurs humains indépendants. C'est cela — et non une affirmation qu'il raisonne comme le ferait un évaluateur humain — qui fonde son usage comme signal de récompense RL à faible variance.

Le résultat, compté directement : Faraday gagne la plupart du temps, pas tout le temps

Faraday — Qwen3.6-27B, affiné par LoRA avec une variante de GRPO à attribution de crédit par tour sur l'ensemble d'entraînement de Replica — surpasse à la fois Claude Opus 4.8 et Codex GPT-5.5 sur 73 % des tâches ML en distribution et 60 % des tâches d'IA pour la science retenues, selon le propre juge de l'article. Les améliorations de score moyennes sont de 6 % par rapport à Claude et 8 % par rapport à Codex sur l'ensemble de test. L'article a aussi testé si un simple travail sur le prompt pouvait combler cet écart : 24 générations d'optimisation automatique de prompt sur la référence Codex (Claude Opus 4.7 réécrivant le prompt à partir des retours de trajectoires à chaque génération) ont laissé le score de Codex essentiellement inchangé, ce qui signifie que l'écart ne venait pas d'une faiblesse de prompt corrigible. Sur le plan qualitatif, les exemples propres à l'article, examinés à la main, sont précis et convaincants sur le principe, même si les trajectoires sous-jacentes ne sont pas publiques. Sur une tâche de réplication de Voyager, la meilleure trajectoire de Claude aurait fourni une bibliothèque de compétences pré-remplie au lieu de faire tourner le processus d'acquisition de compétences que la figure était censée tester, tandis que Faraday a fait tourner le vrai processus d'acquisition-et-transfert que l'article décrit. Si l'exemple rapporté se confirme, c'est une vraie distinction qualitative entre démontrer une sortie et reproduire le mécanisme.

Là où l'article prend soin de ne pas surinterpréter

Deux des tests de suivi de l'article lui-même méritent d'être lus comme délibérément modestes plutôt que comme des confirmations. D'abord, une étude de préférence humaine. Les chercheurs ont sélectionné 41 trajectoires spécifiquement parmi les cas où le juge sur grille disait que Faraday détenait un net avantage, et ont demandé à des humains de comparer ; les humains ont préféré Faraday aux deux références dans 29 cas sur 41. L'article déclare explicitement que ce dispositif « ne permet pas de tirer de conclusions quant à savoir si les humains préfèrent Faraday à Claude et Codex en moyenne », puisque l'échantillon a été sélectionné pour des cas favorisant Faraday plutôt que tiré au hasard. Cette réserve mérite d'être prise au pied de la lettre plutôt que de lire le chiffre de 29/41 comme un taux de préférence général. Ensuite, un test de généralisation sur huit articles nécessitant des budgets de calcul plus importants, jusqu'à huit heures et huit GPU B300. Faraday a battu Claude sur cinq des huit, ce que les auteurs présentent comme un indice de généralisation — tout en notant explicitement qu'une affirmation plus claire nécessiterait que le juge sur grille soit validé séparément à cette échelle plus grande, puisqu'il a été construit et vérifié sur la distribution de tâches à budget plus restreint. L'article a aussi sollicité directement les retours des propres auteurs de quatre articles répliqués, et a rapporté les résultats mitigés sans détour plutôt que seulement les éloges. Il cite de vraies critiques aux côtés des remarques positives, dont le fait que la qualité de rédaction et le style de code de Faraday laissaient parfois à désirer même là où la réplication sous-jacente était solide.

Ce que cela prouve, et ce que cela ne prouve pas

C'est un préprint d'un laboratoire industriel (Inherent Laboratories), soumis le 13 août 2026 — pas encore relu par les pairs, évalué contre un benchmark et un juge construits par la même équipe, et pas encore reproduit de façon indépendante en dehors de l'article. Cette combinaison ne rend pas le résultat faux, mais elle mérite d'être nommée clairement plutôt que de traiter la comparaison auto-jugée d'une entreprise sur son propre modèle comme équivalente à une validation tierce. Ce que l'article étaye bien, à ses propres conditions, c'est l'affirmation structurelle : un modèle de 27 milliards de paramètres, post-entraîné spécifiquement pour décider quoi étudier et comment cadrer une expérience, peut diriger un agent de codage généraliste bien plus grand vers de meilleurs résultats que ceux que cet agent atteint seul — sans que personne n'ait besoin de concevoir à la main un harnais multi-agent spécialisé pour la tâche.

À surveiller

  • Une reproduction indépendante de la comparaison phare. Le juge sur grille et l'ensemble de tâches Replica sont la propre construction de l'article ; qu'un tiers relance la même comparaison, ou construise un juge indépendant, est ce qui trancherait si les taux de victoire de 73 %/60 % tiennent.
  • Le juge sur grille validé à plus grande échelle de calcul. Les auteurs signalent eux-mêmes cet écart — le test de généralisation à huit articles a utilisé un juge qui n'a été vérifié que face au budget de tâche par défaut, plus restreint.
  • Le schéma « agent de codage comme outil » apparaîtra-t-il ailleurs ? La formulation de l'article — un modèle plus petit, post-entraîné, dirigeant un modèle de pointe bien plus grand en tant qu'outil, et battant les tentatives non assistées de ce modèle plus grand — est une affirmation architecturale distincte et testable, indépendante du benchmark de réplication lui-même.

À lire ensuite