2026-07-24

Claude Opus 5 : la doublure qui éclipse la vedette

AI🌍 North America

Anthropic a lancé Claude Opus 5 le 24 juillet 2026 avec un positionnement officiel volontairement modeste : presque toute l'intelligence de Fable 5 pour moitié moins cher — 5 et 25 $ par million de tokens, contre 10 et 50 $ pour Fable —, soit, dans la propre hiérarchie d'Anthropic, un cran en dessous du modèle phare de la gamme Mythos.

Puis les mesures indépendantes sont tombées, et la modestie n'a plus tenu. Opus 5 entre directement en tête de l'Artificial Analysis Intelligence Index, avec 61 points contre 60 pour Fable 5, reléguant GPT-5.6 Sol à la troisième place. Sur les benchmarks maison d'Anthropic, il dépasse Fable 5 en programmation comme en travail intellectuel : 43,3 % sur Frontier-Bench (codage agentique en terminal), soit plus du double des 18,7 % d'Opus 4.8 et bien au-delà des 33,7 % de Fable 5 ; à moins d'un demi-point du meilleur score de Fable 5 sur CursorBench, pour un coût par tâche environ deux fois moindre ; et devant tout le monde, tous prix confondus, sur le pilotage d'ordinateur d'OSWorld.

Les classements vérifiés d'ARC Prize sont plus frappants encore. Sur ARC-AGI-1, Opus 5 atteint 97,5 % pour 0,70 $ par tâche ; sur ARC-AGI-2, 90,4 % pour 2,06 $ par tâche. Dans les deux cas, ARC Prize juge le résultat « comparable à l'état de l'art précédent, pour un coût légèrement supérieur ». Solide, sans plus. C'est sur ARC-AGI-3, le benchmark le plus récent, bâti autour d'environnements de puzzles interactifs et agentiques plutôt que statiques, que l'écart devient franchement étrange : Opus 5 établit un nouveau record à 30,2 %, contre 7,8 % pour le précédent, détenu par GPT-5.6 Sol (Max). Opus 5 ne prend pas la tête d'une courte longueur : il quadruple presque le plafond antérieur. La doublure est désormais devant sur plusieurs mesures, tout en restant officiellement un cran en dessous.

Quand un puzzle devient une équation

Le détail le plus marquant du rapport d'ARC Prize n'est pas le score, mais la manière dont Opus 5 l'obtient. Les environnements d'ARC-AGI-3 sont des puzzles visuels et interactifs, pas des problèmes de mathématiques. Pourtant, à l'action 23 de sa transcription, le modèle décrit une scène en notation algébrique explicite : 4_center = 2×axis − 5_center, une équation de symétrie qu'il a lui-même dérivée pour représenter ce qu'il observait. D'après ARC Prize, c'est la première fois qu'un modèle produit une équation de symétrie explicite dans ce type d'analyse.

Et cela ne s'arrête pas là. À l'action 248, Opus 5 avait généralisé le motif à deux dimensions : "ghost = reflection about axis strips: br' = 2·br_axis − br, bc' = 2·bc_axis − bc." Un modèle découvre et formalise spontanément, en pleine tâche, une règle générale de transformation géométrique, au lieu de puiser dans des motifs mémorisés à l'entraînement. C'est exactement le comportement qu'ARC-AGI-3 cherche à faire apparaître, et qu'aucun modèle de pointe n'avait manifesté jusqu'ici sur ce benchmark.

Les fonctionnalités qui comptent

La fenêtre de contexte d'un million de tokens confirme la fuite qui avait précédé le lancement. La grande nouveauté produit, c'est le réglage de l'effort : faible, moyen, élevé, plus un nouveau mode de raisonnement « xhigh », ajustable à chaque tour. Le curseur coût/capacité cesse ainsi d'être un détail d'infrastructure pour devenir une commande utilisateur de premier plan. Le déploiement a été simultané partout : API, applications Claude, Claude Code, Bedrock, Vertex et GitHub Copilot dès le premier jour, avec passage en réglage par défaut sur Claude Max.

La fiche système réserve un renversement intéressant : Opus 5 s'est révélé moins doué que Fable 5 pour l'exploitation cyber, il est donc livré avec des garde-fous allégés. Contrairement à Fable 5, il n'est pas non plus soumis au régime de rétention des données à 30 jours hérité de l'épisode du contrôle des exportations. Anthropic le présente comme son « modèle Opus le mieux aligné » et comme son modèle le plus performant, en disponibilité générale, pour la recherche scientifique.

Le carnet de prédictions, suite

L'article sur les tendances relevait qu'Anthropic était en retard sur son rythme de sortie habituel — une publication était attendue le 12 juillet — et avançait, après le succès de FLUX 3, qu'un silence prolongé au-delà de la date attendue annonce souvent une sortie plus importante. Opus 5 est arrivé le 24 juillet, douze jours après la date projetée : une sortie majeure, en retard, exactement conforme au schéma. Deux sur deux en une semaine pour les calculs de cadence — Black Forest Labs d'abord, Anthropic ensuite. (La projection de mi-août pour Google est la prochaine échéance.)

Ce que le lancement passe soigneusement sous silence

Deux jours après que la Maison-Blanche a accusé Moonshot d'avoir distillé Fable d'Anthropic, et trois jours avant la publication annoncée des poids ouverts de Kimi K3, les documents de lancement d'Anthropic ne disent rien de la distillation, rien de la sécurité des poids, rien du conflit dont l'entreprise est la victime supposée et la bénéficiaire présumée. Le commentaire le plus proche est venu d'un responsable produit qui, interrogé sur K3, s'est borné à dire qu'il « reste à voir » comment les modèles à poids ouverts se comportent sur des projets réels et complexes. Prudence juridique, patience stratégique ou embarras devant une interdiction réclamée en son nom : quoi qu'il en soit, ce non-dit est ce qu'un lancement par ailleurs très bruyant a de plus assourdissant. Les prix, eux, parlent d'eux-mêmes : diviser par deux le coût d'une intelligence proche de Fable, trois jours avant la plus grosse sortie en poids ouverts de l'année, est une riposte concurrentielle qui se passe de commentaire.