VISTA est un harnais visuel. Propulsé par Claude Opus 5, il termine les 25 jeux publics d'ARC-AGI-3 — 100 % de victoires, un score parfait de 100 en Relative Human Action Efficiency (RHAE), et 56,0 % d'actions en moins que des joueurs humains découvrant les jeux.
Le plus intéressant n'est pas le chiffre. C'est que Schema avait atteint ~99 % sur ces mêmes 25 jeux quelques semaines plus tôt, en construisant un harnais sur la prémisse inverse. Et un troisième résultat a parcouru un tiers du chemin en activant deux réglages d'API. Trois équipes, un benchmark, trois théories incompatibles de ce dont un modèle a besoin — et les trois fonctionnent.
Ce que fait réellement VISTA
Trois choix de conception, tous soustractifs :
Des pixels bruts, sans schéma. L'agent observe un PNG de 512×512 — l'image officielle de 64×64 agrandie 8× par plus proche voisin, avec des lignes de grille d'un pixel entre les cases. On ne lui dit jamais que le monde est une grille de 64×64. Pas de liste d'objets, pas de vecteur d'état, pas de représentation pré-analysée : le harnais transmet l'image et laisse les a priori visuels du modèle faire l'analyse. Les auteurs notent que l'agent forme et découvre de lui-même des concepts visuels — c'est précisément l'intérêt de ne pas pré-digérer l'entrée.
Du langage libre, sans contrainte. L'agent décide de quoi raisonner, dans quelle langue, et pendant combien de temps. Il tient deux fichiers de notes — GUIDE.md pour ce qui reste utile d'un niveau à l'autre, WORKING.md comme brouillon du niveau en cours — avec la consigne de construire un modèle du jeu compact et révisable. « Compact » pousse vers l'abstraction de plus haut niveau, dans l'esprit du rasoir d'Occam ; « révisable » autorise l'agent à se tromper d'abord. Avant chaque action, il doit énoncer le résultat visuel qu'il attend, ce qui transforme chaque coup en une prédiction falsifiable à faible coût plutôt qu'en un pari.
Une mémoire visuelle sans perte. C'est le vrai mécanisme. Chaque image renvoyée par l'environnement — y compris les images d'animation intermédiaires — est stockée avec son index de tour et d'image, sans compression. Un outil inspect ramène dans le champ de vision, par le même canal visuel, n'importe quel état antérieur, image d'animation ou région agrandie ; read_pixels renvoie des échantillons de couleur exacts pour les détails trop fins pour l'œil. Plusieurs vues peuvent être demandées ensemble pour comparaison en lecture seule.
Ce dernier point mérite d'être nommé précisément, comme le font les auteurs : c'est un mécanisme d'attention explicite, opérant à la granularité de l'image, de la région et du pixel, piloté par le modèle plutôt qu'appris. La mémoire d'un VLM standard, c'est le cache KV — implicite, avec perte, compressé, borné. VISTA laisse l'historique de pixels intact à l'extérieur du modèle et laisse le modèle décider quoi y rappeler. À l'approche de sa limite de contexte, il rédige un état de continuation et reprend dans un contexte neuf, avec notes, mémoire visuelle et historique d'actions toujours adressables.
Le désaccord
Schema, présenté en juillet, fait raisonner le modèle comme un physicien : il écrit les mécaniques de chaque jeu sous forme de programme exécutable, teste ce programme rétrospectivement contre l'historique enregistré, puis planifie en cherchant à l'intérieur, à coût d'action nul. Ancrage de l'état et découverte du mécanisme, résolus conjointement, dans un seul modèle du monde symbolique éditable. Sa comparaison contrôlée a fait passer une référence Claude Code de 42,83 % à 98,98 % de RHAE sur ces mêmes 25 jeux.
VISTA ne fait rien de tout cela. Pas de synthèse de programme, pas de recherche, pas de modèle du monde symbolique, pas de boucle de vérification contre l'historique. Il raisonne « de manière floue mais flexible » — la formule est des auteurs, et manifestement délibérée — et ses notes sont de la prose, pas du code.
| Harnais | Modèle(s) de base | Résultat sur l'ensemble public | Mécanisme central |
|---|---|---|---|
| ARC Prize officiel | Claude Opus 5 | 30,2 % (semi-privé, vérifié) | aucun, par conception |
| OpenAI, deux réglages | GPT-5.6 Sol | 13,3 % → 38,3 % | raisonnement retenu + compaction |
| Schema | Opus 4.8 + Fable 5 | ~99 % (auto-déclaré) | modèle du monde symbolique exécutable |
| VISTA | Claude Opus 5 | 100 % (auto-déclaré) | mémoire de pixels sans perte + notes en prose |
Deux harnais bâtis sur des épistémologies contradictoires — compiler le monde en code, ou refuser de le compiler — se retrouvent à un point l'un de l'autre au sommet des mêmes 25 jeux. Cela nous apprend quelque chose, mais certainement pas que l'un des deux détiendrait la bonne théorie : cela nous apprend qu'aux alentours de 99 %, le benchmark a cessé de les départager, et que l'essentiel du mérite revient aux modèles de base autour desquels tous deux sont construits. Ce blog soutenait déjà que le classement v3 classe des paires modèle-harnais plutôt que des modèles. Deux harnais mutuellement exclusifs qui le saturent en sont la version la plus forte à ce jour.
Le point commun à tous
Retirez les architectures : chaque résultat de harnais des deux derniers mois est le même geste — cesser de jeter l'état.
Les deux réglages d'OpenAI — raisonnement retenu et compaction — ont triplé le score de GPT-5.6 Sol sur l'ensemble public, de 13,3 % à 38,3 %, et divisé les tokens de sortie par 6, uniquement en cessant de jeter le raisonnement privé du modèle après chaque action. Schema refuse de jeter les mécaniques inférées, les figeant dans un programme testable plutôt que redérivé. VISTA refuse de jeter les pixels. Aucun n'a touché à un poids.
Et ce n'est pas propre à ARC. Muse Code de Meta ajoute chaque appel de modèle, exécution d'outil, approbation et modification à un journal d'événements local, pour qu'une session plantée reprenne exactement là où elle s'est arrêtée au lieu de redériver son état. Le méganoyau d'entraînement de Cursor vise un déterminisme au bit près, pour qu'une exécution soit reproduite et non redevinée. La capture de trajectoires par proxy de harnais de Liquid enregistre ce qui s'est réellement passé dans de vrais harnais au lieu de le simuler. QM de Y Combinator donne à chaque agent un bac à sable persistant et une identité cloisonnée qui survivent à la session.
Des couches différentes, une même intuition. Les transformeurs oublient par construction : le cache clé-valeur est borné, avec perte, et le modèle ne peut pas l'adresser comme une mémoire. Le harnais est donc l'endroit où l'on loge ce qui n'oublie pas — et les progrès de harnais de 2026 sont, à quelques exceptions près, des progrès d'architecture mémoire sous des formes diverses.
La question que devrait se poser l'utilisateur de l'un de ces systèmes s'en trouve reformulée. Non plus quelle est la qualité du modèle ?, mais que ce harnais dispense-t-il le modèle de reconstruire ?. C'est aujourd'hui un levier plus puissant qu'une génération de modèle.
Ce que ce score parfait ne signifie pas
Les auteurs de VISTA sont exceptionnellement directs sur les limites, et ils méritent qu'on le souligne : les modèles ont été publiés après la publication des jeux publics d'ARC-AGI-3, donc une exposition pendant l'entraînement ne peut être exclue, et ils affirment clairement que l'ensemble privé reste le véritable test de généralisation.
Trois autres réserves s'imposent :
Le 30,2 % et le 100 % ne sont pas la même évaluation. Le 30,2 % vérifié par ARC Prize pour Opus 5 porte sur l'ensemble semi-privé, sous une méthodologie délibérément sans harnais ; le 100 % de VISTA porte sur les 25 jeux publics. Y lire un modèle qui passerait de 30 à 100 est un raccourci trompeur. Ce que cela montre, en revanche, c'est la marge dont dispose un harnais sur des jeux où l'on croyait que la contrainte venait du plafond brut du modèle.
Auto-déclaré veut dire classement communautaire. ARC Prize tient deux classements précisément pour cette raison : l'officiel — sans harnais, vérifié, avec les mêmes observations et les mêmes limites d'actions pour tous les fournisseurs — et un classement communautaire, qui autorise les harnais, accepte les scores auto-déclarés et se déclare explicitement non vérifié. ARC Prize qualifie la recherche sur les harnais d'économiquement précieuse et met en garde dans la même phrase contre la tentation d'y lire un progrès vers l'AGI. Les deux moitiés de cette position sont justes.
La comparaison humaine n'est pas à armes égales. Le RHAE rapporte le nombre d'actions de l'agent à une référence humaine établie en première découverte : des personnes qui abordent un jeu inconnu en une seule fois. L'agent de VISTA dispose d'un retour arrière sans perte vers n'importe quelle image antérieure, d'un zoom arbitraire, d'un échantillonnage exact des pixels et de notes persistantes à travers une réinitialisation de contexte. Consommer 56 % d'actions de moins qu'un humain est un vrai résultat pour le harnais ; ce n'est pas la preuve que le modèle explore plus intelligemment qu'une personne dotée des mêmes moyens. Rappelons aussi qu'un score RHAE de 100 signifie égaler ou dépasser la référence humaine à chaque niveau — le crédit par niveau est plafonné — et non se montrer cent fois plus efficace.
À surveiller ensuite
- L'ensemble privé est le seul test qui tranchera. Deux harnais à ~99–100 % sur 25 jeux connus, c'est une affirmation sur 25 jeux connus. Celui de ces designs qui survivra sur des environnements que ses auteurs n'ont jamais vus sera celui qui parlait vraiment de mémoire plutôt que de familiarité.
- L'extension 3D est la revendication la plus intéressante. VISTA note que son cadre n'est pas restreint à la 2D et démontre un cas d'observation en 3D. Une mémoire sensorielle sans perte avec ré-inspection pilotée par le modèle est une idée bien plus lourde de conséquences en contexte incarné que dans un jeu de grille, et c'est là qu'il faudra la juger.
- Les ablations de harnais vont devenir un matériau de publication standard. Schema a publié une comparaison contrôlée face à une référence ; OpenAI a publié une étude d'ablation sur ses réglages. Dès lors que « quel harnais » déplace autant de score, publier un chiffre de modèle sans le harnais dans lequel il a tourné cesse d'avoir un sens.