xAI a livré Grok 4.6 aujourd'hui, un jour après le lancement en bêta publique de Grok Bot — la même cadence de sortie que j'avais signalée comme étant le but des quatre derniers mois de transactions SpaceXAI/Cursor. Le positionnement est explicite : « un accent particulier sur les agents à longue durée et un travail interactif et visuel plus ambitieux », rester sur des tâches complexes à plusieurs étapes — rechercher un sujet, travailler sur une base de code, ou transformer une idée en un artefact abouti. L'affirmation phare de xAI elle-même est que Grok 4.6 « égale GPT-5.6 Sol sur l'Artificial Analysis Intelligence Index ». C'est vrai. C'est aussi la phrase la moins intéressante d'un tableau à neuf benchmarks qui raconte une histoire plus précise que le score composite.
Ce que le tableau montre réellement
Voici le propre tableau comparatif de xAI, reproduit : Grok 4.6 High contre Grok 4.5 High contre GPT-5.6 Sol Max contre Claude Fable 5 Max. Une réserve d'emblée : xAI décrit les chiffres tiers comme « le meilleur des résultats auto-déclarés ou publiquement disponibles », ce qui signifie que xAI a choisi lesquels des chiffres de ses rivaux citer — pas que xAI a mené les comparaisons elle-même.
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9 % | 66,7 % | 67,2 % | 70,5 % |
| DeepSWE v1.1 | 65,9 % | 54 % | 73 % | 70 % |
| FrontierCode v1.1 (Extended) | 61,3 % | 56,6 % | 60,6 % | 63,6 % |
| APEX-Agents | 57,5 % | 47,1 % | 56,7 % | 59,2 % |
| Terminal-Bench v3.0 | 26 % | 15,7 % | 34,6 % | 34,1 % |
| APEX-SWE | 56,4 % | 53,6 % | — | 58,8 % |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8 % | 12,9 % | 2,5 % | 11,3 % |
Comptez les victoires et le cadrage par score composite devient moins flatteur : Fable 5 Max mène sur cinq des neuf mesures (AA Intelligence Index, CursorBench, FrontierCode, APEX-Agents, APEX-SWE), GPT-5.6 Sol Max mène sur deux (DeepSWE, Terminal-Bench), et Grok 4.6 mène sur trois (GDPVal-AA, AA-Briefcase, Harvey LAB). « Égale GPT-5.6 Sol » est exact sur l'unique mesure composite que xAI a choisi de mettre en avant. Mais ce n'est pas la mesure où Grok 4.6 paraît réellement le plus fort, et cela ne décrit pas du tout la position de Fable 5 — qui mène plus souvent que l'un ou l'autre des modèles auxquels xAI s'est directement comparée.
Le vrai motif : le travail de connaissance et un secteur précis, pas les agents de codage classiques
La forme des victoires réelles de Grok 4.6 est plus instructive que le titre. Ses trois victoires nettes — GDPVal-AA (un indice de tâches à valeur économique réelle), AA-Briefcase (tâches de travail de connaissance), et Harvey LAB (Vals) — se regroupent autour du travail de bureau et professionnel au sens large. Le résultat marquant est Harvey LAB en particulier : un benchmark de domaine juridique où Grok 4.6 affiche 15,8 % contre les 2,5 % étonnamment bas de GPT-5.6 Sol. C'est un écart de 6x sur un secteur précis, qui se lit soit comme une véritable spécialisation, soit comme un benchmark pour lequel GPT-5.6 Sol n'était simplement pas réglé — un examen indépendant serait utile dans les deux cas.
Là où il ne mène pas, c'est sur le groupe classique des agents de codage : DeepSWE, Terminal-Bench, CursorBench, FrontierCode et APEX-SWE vont tous soit à Fable 5, soit à GPT-5.6 Sol. Cela crée une certaine tension avec les termes mêmes de l'annonce, qui cite explicitement « travailler sur une base de code » comme cas d'usage cible. Les chiffres disent que Grok 4.6 est un agent de codage compétent mais pas en tête, et un modèle réellement fort en travail de connaissance et en domaine juridique. L'histoire intéressante de Grok 4.6 est plus étroite et plus précise que ce que « intelligence de frontière » laisse entendre, et aussi plus utile si elle se confirme : un modèle bon pour les tâches de bureau et professionnelles n'est pas une histoire moindre qu'un leader de benchmark de codage, c'en est une différente.
Entraînement : le modèle enseignant les données de son propre successeur
xAI décrit un entraînement complémentaire plus long que celui de 4.5, avec des données générées par modèle et sélectionnées pour le raisonnement et les concepts techniques, plus un optimiseur et une recette améliorés comme fondation pour les étapes SFT/RL. Le détail le plus intéressant : Grok 4.5 a été utilisé pour régénérer les trajectoires SFT de 4.6 — à travers les niveaux d'effort de raisonnement, les harnais d'agents et les domaines — avec un filtrage basé sur un modèle pour éliminer les mauvaises traces. C'est le même schéma d'auto-amorçage que l'on a désormais vu chez Meta (Spark 1.1 notant les solutions candidates de Spark 1.2) et implicitement dans le MOPD de Liquid : utiliser la génération précédente comme enseignante des données d'entraînement de la génération suivante, plutôt que de générer uniquement à partir de zéro. Cela devient un geste standard à travers les laboratoires, pas une technique isolée.
L'entraînement RL a couvert « un large éventail de tâches RL agentiques » — travail de connaissance, codage général, et environnements spécifiques à un domaine pour l'optimisation de noyaux, le développement web et la CAO. xAI rapporte aussi que Grok 4.6 montre davantage de comportement d'auto-test et de vérification sur les trajectoires longues — « vérifier son propre travail avant de passer à la suite » — ce qui est une affirmation qualitative, non benchmarkée, pas une mesure notée, et qu'il vaut mieux traiter comme telle tant que personne ne la mesure directement.
La section sécurité en dit beaucoup en disant peu
Comparez l'écart de précision. D'un côté : neuf benchmarks de capacité quantifiés avec des scores exacts. De l'autre : un paragraphe sécurité qui dit que les garde-fous ont été « améliorés et calibrés en fonction des capacités du modèle », appuyé par « notre suite de tests pré-déploiement la plus large à ce jour » et des « tests post-déploiement et tiers étendus » — pas de chiffres, pas de tiers nommés, pas de résultats d'équipe rouge publiés à côté du tableau détaillé des capacités. Ce n'est pas inhabituel pour un lancement de modèle, mais c'est une vraie asymétrie qui mérite d'être nommée chaque fois qu'elle apparaît : les parties d'une sortie faciles à quantifier ont droit à un tableau, celles difficiles à quantifier ont droit à des adjectifs.
Disponibilité et tarification
Grok 4.6 est disponible dès aujourd'hui dans Cursor, Grok Build, l'API, et des partenaires dont OpenRouter, Vercel et Cloudflare. La tarification reste à 2 $/6 $ par million de tokens en entrée/sortie — inchangée par rapport au tarif de base de Grok 4.5 — avec une variante rapide à un 2x net (4 $/12 $). C'est une structure plus simple que le palier rapide de 4.5, qui tournait à un asymétrique 4 $/18 $ — un vrai changement de structure tarifaire, pas juste une mise à jour de chiffre. Une promotion de première semaine double l'usage inclus dans Grok Build et Cursor. Aucune annonce de poids ouverts n'accompagne cette sortie — la promesse de xAI/SpaceXAI, faite dans le même souffle que son adhésion à l'Open Secure AI Alliance, d'ouvrir un jour les poids de Grok reste non tenue pour la gamme phare à ce lancement.
Mise à jour (13 août) : ARC Prize vérifie, et l'affirmation d'efficacité tient
Une confirmation indépendante est arrivée vite, même si pas sur Harvey LAB. ARC Prize — l'organisme à but non lucratif qui gère la suite de benchmarks ARC-AGI et vérifie indépendamment les soumissions des éditeurs plutôt que d'accepter des auto-déclarations — a publié des résultats vérifiés pour Grok 4.6 : 87,5 % sur ARC-AGI-1 à 0,30 $/tâche, 67,1 % sur ARC-AGI-2 à 0,76 $/tâche, et 2,11 % sur ARC-AGI-3 à 5,6 K$ au total. C'est une source nettement plus solide que le propre tableau de lancement de xAI : un badge « VERIFIED » plutôt qu'une auto-déclaration d'éditeur, la même distinction que ce jeu de données a suivie tout le mois entre les points pleins (vérifiés) et hachurés (auto-déclarés) du classement ARC-AGI-3.
La comparaison générationnelle vaut aussi le coup : les propres scores vérifiés de Grok 4.5 étaient 85,7 % / 0,33 $ (ARC-AGI-1), 52,6 % / 0,78 $ (ARC-AGI-2), et 0,3 % / 6,9 K$ (ARC-AGI-3). Grok 4.6 a amélioré chaque score tout en maintenant un coût stable ou inférieur — un vrai gain générationnel confirmé indépendamment, le plus spectaculaire sur ARC-AGI-2 (52,6 % → 67,1 %) et, en termes relatifs, sur ARC-AGI-3 (0,3 % → 2,11 %, environ 7x, bien que le chiffre absolu reste faible).
L'affirmation d'efficacité est réelle et précise : sur ARC-AGI-3, Grok 4.6 avec un raisonnement xhigh a obtenu un score comparable à GPT-5.6 Sol avec un raisonnement high, à 5,6 K$ contre 15,2 K$ pour Sol — environ un tiers du coût pour un résultat similaire. Mais il faut lire le graphique avant de répéter cela comme une victoire. Chaque modèle regroupé dans cette bande de coût 1K$-20K$ — Grok 4.6, GPT-5.5, GPT-5.6 Sol aux deux niveaux d'effort, Gemini 3.1 Pro — note sous les 10 % sur ARC-AGI-3. La comparaison d'efficacité est réelle au sein d'un groupe de modèles qui échouent tous encore largement le benchmark. Claude Opus 5 (High) se situe seul près de 30 %, dans une partie entièrement différente du graphique, à un ordre de grandeur de coût comparable. « Efficace à 2 % » et « capable à 30 % » sont des axes différents, et le graphique vérifié rend cet écart plus difficile à manquer que ne le faisait le propre tableau de xAI.
À surveiller
- Une vérification indépendante sur Harvey LAB spécifiquement. ARC Prize couvre ARC-AGI, pas le benchmark de domaine juridique — un écart de 6x sur GPT-5.6 Sol y reste non confirmé par quiconque en dehors de xAI. Une véritable spécialisation ou un benchmark pour lequel GPT-5.6 Sol n'était simplement pas réglé — une évaluation juridique-IA tierce trancherait dans un sens ou dans l'autre.
- Si « auto-déclaré tiers » reste la norme pour le reste de ce tableau comparatif. ARC Prize a comblé cet écart pour ARC-AGI spécifiquement. La propre note de bas de page de xAI concède toujours que les huit autres benchmarks sont cités depuis les chiffres publiés par ses rivaux, pas menés tête-à-tête — un écart méthodologique que chaque laboratoire de cette comparaison partage en dehors de l'unique benchmark qui dispose désormais d'une vérification indépendante.
- La mesure de l'affirmation d'auto-vérification. « Plus d'auto-test sur les trajectoires longues » est une affirmation comportementale réelle et vérifiable si quelqu'un construit une évaluation pour cela — pour l'instant c'est une anecdote dans un billet de lancement.
- La promesse de poids ouverts. xAI a rejoint une alliance plaidant pour une IA défensive ouverte et inspectable tout en livrant son modèle phare fermé pour la deuxième sortie consécutive ; l'écart entre cette position déclarée et le schéma de sortie réel de Grok mérite d'être suivi comme sa propre histoire.