VISTA est un harnais visuel. Propulsé par Claude Opus 5, il termine les 25 jeux publics d'ARC-AGI-3 — 100% de victoires, un score parfait de 100 en Relative Human Action Efficiency (RHAE), et 56,0% d'actions en moins que des joueurs humains découvrant les jeux.
Le plus intéressant n'est pas le chiffre. C'est que Schema avait atteint ~99% sur ces mêmes 25 jeux quelques semaines plus tôt en construisant un harnais sur la prémisse inverse, et qu'un troisième résultat a parcouru un tiers du chemin en activant deux réglages d'API. Trois équipes, un benchmark, trois théories incompatibles de ce dont un modèle a besoin — et les trois fonctionnent.
Ce que fait réellement VISTA
Trois choix de conception, tous soustractifs :
Des pixels bruts, sans schéma. L'agent observe un PNG de 512×512 — l'image officielle de 64×64 agrandie 8× par plus proche voisin, avec des lignes de grille d'un pixel entre les cases. On ne lui dit jamais que le monde est une grille de 64×64. Pas de liste d'objets, pas de vecteur d'état, pas de représentation pré-analysée : le harnais transmet l'image et laisse les a priori visuels du modèle faire l'analyse. Les auteurs notent que l'agent forme et découvre de lui-même des concepts visuels — c'est précisément l'intérêt de ne pas pré-digérer l'entrée.
Du langage libre, sans contrainte. L'agent décide de quoi raisonner, dans quelle langue, et pendant combien de temps. Il tient deux fichiers de notes — GUIDE.md pour ce qui reste utile d'un niveau à l'autre, WORKING.md comme brouillon du niveau en cours — avec la consigne de construire un modèle du jeu compact et révisable. « Compact » pousse vers l'abstraction de plus haut niveau, dans l'esprit du rasoir d'Occam ; « révisable » autorise l'agent à se tromper d'abord. Avant chaque action, il doit énoncer le résultat visuel qu'il attend, ce qui transforme chaque coup en une prédiction falsifiable à faible coût plutôt qu'en un pari.
Une mémoire visuelle sans perte. C'est le vrai mécanisme. Chaque image renvoyée par l'environnement — y compris les images d'animation intermédiaires — est stockée avec son index de tour et d'image, sans compression. Un outil inspect ramène n'importe quel état passé, image d'animation ou région agrandie dans le champ de vision par le même canal visuel ; read_pixels retourne des échantillons de couleur exacts pour les détails trop fins à l'œil. Plusieurs vues peuvent être demandées ensemble pour comparaison en lecture seule.
Ce dernier point mérite d'être nommé précisément, comme le font les auteurs : c'est un mécanisme d'attention explicite, opérant à la granularité de l'image, de la région et du pixel, piloté par le modèle plutôt qu'appris. La mémoire d'un VLM standard, c'est le cache KV — implicite, avec perte, compressé, borné. VISTA laisse l'historique de pixels intact à l'extérieur du modèle et laisse le modèle décider quoi y rappeler. À l'approche de sa limite de contexte, il rédige un état de continuation et reprend dans un contexte neuf, avec notes, mémoire visuelle et historique d'actions toujours adressables.
Le désaccord
Schema, présenté en juillet, fait raisonner le modèle comme un physicien : il écrit les mécaniques de chaque jeu sous forme de programme exécutable, teste ce programme rétrospectivement contre l'historique enregistré, puis planifie en cherchant à l'intérieur, à coût d'action nul. Ancrage de l'état et découverte du mécanisme, résolus conjointement, dans un seul modèle du monde symbolique éditable. Sa comparaison contrôlée a fait passer une base Claude Code de 42,83% à 98,98% de RHAE sur ces mêmes 25 jeux.
VISTA ne fait rien de tout cela. Pas de synthèse de programme, pas de recherche, pas de modèle du monde symbolique, pas de boucle de vérification contre l'historique. Il raisonne « de manière floue mais flexible » — la formule est des auteurs, et manifestement délibérée — et ses notes sont de la prose, pas du code.
| Harnais | Modèle(s) de base | Résultat sur le set public | Mécanisme central |
|---|---|---|---|
| ARC Prize officiel | Claude Opus 5 | 30,2% (semi-privé, vérifié) | aucun, par conception |
| OpenAI, deux réglages | GPT-5.6 Sol | 13,3% → 38,3% | raisonnement retenu + compaction |
| Schema | Opus 4.8 + Fable 5 | ~99% (auto-déclaré) | modèle du monde symbolique exécutable |
| VISTA | Claude Opus 5 | 100% (auto-déclaré) | mémoire de pixels sans perte + notes en prose |
Deux harnais bâtis sur des épistémologies contradictoires — compiler le monde en code, ou refuser de le compiler — se retrouvent à un point l'un de l'autre au sommet des mêmes 25 jeux. Cela nous apprend quelque chose, mais pas que l'un des deux a trouvé la bonne théorie. Cela nous apprend qu'à ~99%, le benchmark a cessé de les discriminer, et que l'essentiel du mérite revient aux modèles de base autour desquels les deux sont enroulés. Ce blog soutenait déjà que le classement v3 classe des paires modèle-harnais plutôt que des modèles. Deux harnais mutuellement exclusifs qui le saturent en sont la version la plus forte à ce jour.
Le point commun à tous
Retirez les architectures : chaque résultat de harnais des deux derniers mois est le même geste — cesser de jeter l'état.
Les deux réglages d'OpenAI — raisonnement retenu et compaction — ont triplé le score de GPT-5.6 Sol sur le set public, de 13,3% à 38,3%, et divisé les tokens de sortie par 6, uniquement en cessant de jeter le raisonnement privé du modèle après chaque action. Schema refuse de jeter les mécaniques inférées, les figeant dans un programme testable plutôt que redérivé. VISTA refuse de jeter les pixels. Aucun n'a touché à un poids.
Et ce n'est pas propre à ARC. Muse Code de Meta ajoute chaque appel de modèle, exécution d'outil, approbation et modification à un journal d'événements local, pour qu'une session plantée reprenne exactement là où elle s'est arrêtée au lieu de redériver son état. Le megakernel d'entraînement de Cursor est conçu pour un déterminisme au bit près, afin qu'une exécution soit reproduite plutôt que re-devinée. La capture de trajectoires par proxy de harnais de Liquid enregistre ce qui s'est réellement passé dans de vrais harnais au lieu de le simuler. QM de Y Combinator donne à chaque agent un bac à sable durable et une identité cadrée qui survivent à la session.
Des couches différentes, un même instinct. Les transformeurs oublient par construction : le cache KV est borné, avec perte, et non adressable par le modèle en tant que mémoire. Le harnais est l'endroit où l'on place ce qui n'oublie pas — et les avancées de harnais de 2026 sont, presque sans exception, des avancées d'architecture mémoire sous des costumes différents.
Ce qui reformule la question que devrait se poser l'utilisateur de n'importe lequel de ces systèmes. Non pas quelle est la qualité du modèle, mais qu'est-ce que ce harnais dispense le modèle de redériver. C'est aujourd'hui un levier plus puissant qu'une génération de modèle.
Ce que le 100 ne signifie pas
Les auteurs de VISTA sont exceptionnellement directs sur les limites, et ils méritent qu'on le souligne : les modèles ont été publiés après la sortie des jeux publics d'ARC-AGI-3, donc une exposition pendant l'entraînement ne peut être exclue, et ils affirment clairement que le set privé reste le véritable test de généralisation.
Trois autres réserves s'imposent :
Le 30,2% et le 100% ne sont pas la même évaluation. Le 30,2% vérifié par ARC Prize pour Opus 5 porte sur le set semi-privé, sous une méthodologie délibérément sans harnais ; le 100% de VISTA porte sur les 25 jeux publics. Y lire un modèle passant de 30 à 100 est la mauvaise flèche. Ce que cela montre, en revanche, c'est la marge dont dispose un harnais sur des jeux où l'on supposait que le plafond brut du modèle était la contrainte.
Auto-déclaré signifie classement communautaire. ARC Prize maintient deux classements exactement pour cela : l'officiel, sans harnais, vérifié, mêmes observations et mêmes limites d'actions pour tous les fournisseurs ; et un classement communautaire qui autorise les harnais, accepte les scores auto-déclarés et n'est explicitement pas vérifié. ARC Prize qualifie la recherche sur les harnais d'économiquement précieuse et met en garde dans la même phrase contre la tentation d'y lire un progrès vers l'AGI. Les deux moitiés de cette position sont justes.
La comparaison humaine n'est pas à armes égales. Le RHAE note le nombre d'actions d'un agent par rapport à une base humaine de première exposition — des personnes qui découvrent un jeu inconnu en une seule passe. L'agent de VISTA dispose d'un retour arrière sans perte vers n'importe quelle image antérieure, d'un zoom arbitraire, d'un échantillonnage exact des pixels et de notes persistantes à travers une réinitialisation de contexte. Utiliser 56% d'actions en moins qu'un humain est un vrai résultat sur le harnais ; ce n'est pas la preuve que le modèle explore plus intelligemment qu'une personne disposant des mêmes moyens. Rappelons aussi qu'un score RHAE parfait de 100 signifie égaler ou dépasser la base d'actions humaine à chaque niveau — le crédit par niveau est plafonné — et non être cent fois plus efficace.
À surveiller ensuite
- Le set privé est le seul test qui tranchera. Deux harnais à ~99–100% sur 25 jeux connus, c'est une affirmation sur 25 jeux connus. Celui de ces designs qui survivra sur des environnements que ses auteurs n'ont jamais vus sera celui qui parlait vraiment de mémoire plutôt que de familiarité.
- L'extension 3D est la revendication la plus intéressante. VISTA note que son cadre n'est pas restreint à la 2D et démontre un cas d'observation en 3D. Une mémoire sensorielle sans perte avec ré-inspection pilotée par le modèle est une idée bien plus lourde de conséquences en contexte incarné que dans un jeu de grille, et c'est là qu'il faudra la juger.
- Les ablations de harnais vont devenir un matériau de publication standard. Schema a publié une comparaison contrôlée à une base ; OpenAI a publié une ablation de réglages. Dès lors que « quel harnais » déplace autant de score, publier un chiffre de modèle sans le harnais dans lequel il a tourné cesse d'avoir un sens.
Références : VISTA — A Visual Harness · Harnais Schema · OpenAI — How enabling two settings tripled our scores on the ARC-AGI-3 benchmark · ARC Prize — classement communautaire · ARC Prize — politique de tests vérifiés · suite : Prime Agent et la troisième théorie de la mémoire · couverture liée : ARC-AGI, expliqué · Muse Code de Meta · Des noyaux ouverts que vous ne pouvez pas exécuter · Le harnais QM de YC