2026-08-21

AVO de NVIDIA atteint aussi 100 % sur ARC-AGI-3 — le vrai résultat, c'est un kernel qui bat cuDNN de 3,5 %

AIBenchmarksInfrastructure🌍 North America

NVIDIA a publié des résultats pour AVO (Agentic Variation Operators), une architecture d'agent généraliste à long horizon, sur deux tâches très différentes : l'optimisation autonome de kernels GPU, et le benchmark de raisonnement interactif ARC-AGI-3. Le chiffre phare est un RHAE parfait de 100,00 sur les 25 environnements de l'ensemble public, 183 niveaux, en utilisant Claude Opus 5. C'est un vrai résultat, et il vaut aussi la peine de le dire clairement avant toute autre chose : c'est le troisième harnais en deux mois à atteindre ce même plafond sur ce benchmark précis, avec une troisième conception incompatible.

Trois harnais, trois conceptions, un benchmark saturé

VISTA y arrive avec une mémoire visuelle sans perte que le modèle peut réinspecter à l'échelle de la trame, de la région ou du pixel. Schema y arrive en écrivant la mécanique de chaque jeu sous forme de programme exécutable et rejouable, puis en planifiant à l'intérieur de celui-ci à coût d'action nul. AVO y arrive encore différemment : une boucle persistante en cinq étapes — inspecter le contexte, planifier, implémenter, évaluer, diagnostiquer et réparer — avec un superviseur externe qui surveille les blocages de progression et intervient quand la boucle principale plafonne, opérant sur des observations en grille texte pure de 64×64, sans aucune image. NVIDIA décrit sa propre approche comme adoptant la philosophie d'« interaction directe » de VISTA (pas de modèle du monde compilé explicitement à l'avance, contrairement à Schema ou au système Tycho également cité par NVIDIA) tout en réimplémentant l'interface de tâche de façon indépendante et en remplaçant les observations en pixels de VISTA par de simples grilles de texte.

Trois architectures qui ne s'accordent pas entre elles sur l'endroit où devrait résider la compréhension du monde par un agent — les pixels, un programme compilé, ou une mémoire structurée persistante — convergent toutes vers le même score parfait. La conclusion tirée par ce blog quand VISTA et Schema ont fait cela pour la première fois s'applique de nouveau, avec maintenant un troisième point de confirmation : l'ensemble public d'ARC-AGI-3 a cessé de distinguer les conceptions de harnais de pointe. Aucun de ces résultats ne touche au moindre poids de modèle, et un désaccord aussi total entre des architectures qui atterrissent toutes à 100 % est en soi la découverte, pas une note de bas de page à celle-ci.

La comparaison offerte par NVIDIA, et la réserve que NVIDIA elle-même y attache

Le propre billet de NVIDIA avance une affirmation précise et vérifiable : AVO a résolu les 183 niveaux de l'ensemble public en 6 624 actions dans l'environnement, contre 7 542 rapportées pour VISTA sur les mêmes niveaux — environ 12 % de moins. Immédiatement après avoir énoncé ce chiffre, NVIDIA ajoute sa propre réserve : « ceci ne devrait pas être interprété comme une ablation contrôlée » — les deux systèmes diffèrent simultanément sur le moteur d'agent, le format d'observation, la conception de la mémoire et la gestion du contexte, donc l'écart de nombre d'actions ne peut être attribué à un seul choix architectural. C'est une vraie retenue méthodologique qui mérite d'être créditée en soi — un laboratoire citant une comparaison favorable puis refusant explicitement d'en surinterpréter la portée n'est pas la norme de l'industrie ce mois-ci.

L'autre chiffre qui mérite qu'on s'y arrête : le chiffre propre et vérifié d'ARC Prize pour Claude Opus 5 à effort de raisonnement élevé, sans harnais, est d'environ 30 % sur l'ensemble public. AVO a fait passer ce même modèle de base à 100 %. C'est le vrai point de NVIDIA, énoncé directement dans son propre billet — « le modèle compte, mais le modèle n'est pas l'agent entier » — et c'est un point réel, même s'il s'agit du même point que Prime Agent, VISTA et Schema ont chacun déjà fait valoir avec leurs propres harnais cette année.

Ensemble public, auto-rapporté — la même réserve que chaque harnais cette année

Le RHAE de 100,00 d'AVO porte sur l'ensemble public à 25 environnements, explicitement pas sur les ensembles semi-privé ou privé de la compétition qu'ARC Prize administre et vérifie elle-même. C'est la réserve identique qui s'applique aux chiffres d'ensemble public de VISTA et de Schema, et NVIDIA l'énonce clairement plutôt que de laisser le chiffre de 100 % laisser entendre une performance vérifiée de niveau compétition. À retenir pour la même raison que cela a compté à chaque fois ce mois-ci : l'ensemble public est celui contre lequel un constructeur de harnais peut itérer directement, exactement le cadre où c'est le harnais — plutôt que le modèle — qui fait le travail.

Ce que dit le créateur d'ARC-AGI de tout cela

François Chollet — le chercheur qui a créé ARC-AGI lui-même — a réagi directement à l'annonce de NVIDIA, et sa réaction aiguise un point que ce billet fait déjà tout en compliquant un autre. (Rapporté à partir d'une capture d'écran fournie directement, pas d'un lien récupéré de façon indépendante — à signaler puisque cet environnement ne peut pas accéder à x.com pour vérifier que le message n'a pas été modifié.)

Sur la réserve concernant l'ensemble public, Chollet est plus direct que NVIDIA ou ce billet : « obtenir 100 % sur l'ensemble de démonstration public n'est pas la même chose qu'"obtenir 100 % sur le benchmark ARC-AGI-3". Ce serait comme dire qu'on a fini un jeu vidéo parce qu'on a terminé le niveau tutoriel. » C'est exactement le même point que celui fait plus haut, mais venant de la personne qui a effectivement construit le benchmark et administre les ensembles semi-privé et privé qu'aucun de ces harnais n'a touchés — une autorité plus forte pour la même réserve, pas une nouvelle.

Sur l'architecture, en revanche, sa caractérisation s'accorde moins bien avec le propre récit de NVIDIA. Chollet : « Comme toutes les approches performantes sur ARC-AGI-3, elle utilise une synthèse à la volée, guidée par apprentissage profond, de modèles du monde symboliques, c'est-à-dire naviguer dans le monde en générant des programmes pour représenter ce qu'on sait. » Le propre billet de NVIDIA décrit AVO comme adoptant la philosophie d'« interaction directe » de VISTA *précisément parce qu'*il ne compile pas de modèle du monde explicite à l'avance, contrairement à Schema ou Tycho, et fonctionne sur de simples observations en grille de texte plutôt que sur une quelconque représentation de programme symbolique. Que ce soit un écart de vocabulaire — une boucle en cinq étapes inspecter/planifier/implémenter/évaluer/diagnostiquer pourrait plausiblement fonctionner comme une synthèse de modèle du monde à la volée même sans que NVIDIA la décrive en ces termes — ou un vrai désaccord sur ce qu'AVO fait réellement sous le capot, ce billet ne peut pas le trancher de l'extérieur. À signaler comme une tension ouverte plutôt qu'à résoudre dans un sens ou l'autre.

Le résultat sur les kernels GPU est la nouvelle la plus intéressante, et reçoit moins d'attention

Enfoui sous le titre ARC-AGI-3 se trouve un résultat au bénéfice pratique plus direct : en tournant en continu pendant sept jours, en explorant plus de 500 directions d'optimisation, et en validant 40 versions de kernel, AVO a fait évoluer des kernels d'attention multi-tête qui ont surpassé cuDNN de jusqu'à 3,5 % et FlashAttention-4 de jusqu'à 10,5 % sur du matériel NVIDIA DGX B200 — puis a adapté le résultat à l'attention par requêtes groupées en environ 30 minutes de travail autonome supplémentaire. Battre cuDNN et FlashAttention-4, deux bibliothèques de production matures et lourdement optimisées, sur du matériel réel, est un résultat d'ingénierie concret avec un cas d'usage immédiat, d'une façon qu'un benchmark de raisonnement saturé ne l'est plus. Le propre cadrage de NVIDIA place le transfert entre ces deux tâches très différentes — optimisation de kernel et raisonnement de jeu interactif — devant l'un ou l'autre score individuel : la même boucle centrale (formuler une hypothèse, agir, observer, préserver l'état, réviser, récupérer, continuer) s'est généralisée entre domaines sans reconception, ce qui est l'affirmation la plus durable que n'importe quel chiffre de benchmark isolé.

À surveiller

  • Les résultats sur les ensembles semi-privé et privé d'ARC-AGI-3. Chaque harnais de cette année, AVO inclus, n'a publié que des chiffres d'ensemble public ; les propres scores vérifiés d'ARC Prize sur les ensembles plus durs sont le vrai test de savoir si l'une de ces conceptions se généralise au-delà d'un benchmark contre lequel ses concepteurs peuvent s'entraîner directement.
  • La reproduction indépendante du résultat d'optimisation de kernel. Une amélioration de 3,5 %/10,5 % par rapport à cuDNN et FlashAttention-4 est précise et réfutable d'une façon qu'un score de benchmark saturé ne l'est plus — un benchmarking tiers sur le même matériel trancherait la question.
  • Si les résultats inter-modèles d'AVO (GPT-5.6 Sol aux côtés de Claude Opus 5) reçoivent une comparaison systématique complète. Le propre cadrage de NVIDIA qualifie les résultats actuels sur Sol de « préliminaires » et « limités » — une vraie comparaison, pas un sous-ensemble, est la prochaine donnée utile.

Références : NVIDIA — NVIDIA AVO Reaches 100% on ARC-AGI-3 · couverture liée : Deux harnais résolvent le même benchmark en s'opposant sur la mémoire · Prime Agent dépasse la ligne humaine de 0,1 point · ARC-AGI expliqué · Frontier Arcade : tendances et prédictions