2026-08-12

Grok 4.6 : « égale GPT-5.6 Sol » est vrai, et c'est aussi la ligne la moins intéressante du tableau

AIBenchmarks🌍 North America

xAI a livré Grok 4.6 aujourd'hui, un jour après le lancement en bêta publique de Grok Bot — la même cadence de sortie que nous avions signalée comme étant le but des quatre derniers mois de transactions SpaceXAI/Cursor. Le positionnement est explicite : « un accent particulier sur les agents à longue durée et un travail interactif et visuel plus ambitieux », rester sur des tâches complexes à plusieurs étapes — rechercher un sujet, travailler sur une base de code, ou transformer une idée en un artefact abouti. L'affirmation phare de xAI elle-même est que Grok 4.6 « égale GPT-5.6 Sol sur l'Artificial Analysis Intelligence Index ». C'est vrai. C'est aussi la phrase la moins intéressante d'un tableau à neuf benchmarks qui raconte une histoire plus précise que le score composite.

Ce que le tableau montre réellement

En reproduisant le propre tableau comparatif de xAI (Grok 4.6 High contre Grok 4.5 High contre GPT-5.6 Sol Max contre Claude Fable 5 Max, les chiffres tiers étant, selon xAI, « le meilleur des résultats auto-déclarés ou publiquement disponibles » — une réserve à signaler d'emblée, puisqu'elle signifie que xAI a choisi lesquels des chiffres de ses rivaux citer, pas que xAI a mené les comparaisons elle-même) :

BenchmarkGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269,9 %66,7 %67,2 %70,5 %
DeepSWE v1.165,9 %54 %73 %70 %
FrontierCode v1.1 (Extended)61,3 %56,6 %60,6 %63,6 %
APEX-Agents57,5 %47,1 %56,7 %59,2 %
Terminal-Bench v3.026 %15,7 %34,6 %34,1 %
APEX-SWE56,4 %53,6 %58,8 %
AA-Briefcase1577131315021574
Harvey LAB (Vals)15,8 %12,9 %2,5 %11,3 %

Comptez les victoires et le cadrage par score composite devient moins flatteur : Fable 5 Max mène sur cinq des neuf mesures (AA Intelligence Index, CursorBench, FrontierCode, APEX-Agents, APEX-SWE), GPT-5.6 Sol Max mène sur deux (DeepSWE, Terminal-Bench), et Grok 4.6 mène sur trois (GDPVal-AA, AA-Briefcase, Harvey LAB). « Égale GPT-5.6 Sol » est exact sur l'unique mesure composite que xAI a choisi de mettre en avant ; ce n'est pas la mesure où Grok 4.6 paraît réellement le plus fort, et cela ne décrit pas du tout la position de Fable 5, qui mène plus souvent que l'un ou l'autre des modèles auxquels xAI s'est directement comparée.

Le vrai motif : le travail de connaissance et un secteur précis, pas les agents de codage classiques

La forme des victoires réelles de Grok 4.6 est plus instructive que le titre. Ses trois victoires nettes — GDPVal-AA (un indice de tâches à valeur économique réelle), AA-Briefcase (tâches de travail de connaissance), et Harvey LAB (Vals) — se regroupent autour du travail de bureau et professionnel au sens large, avec un résultat marquant sur Harvey LAB en particulier : un benchmark de domaine juridique où Grok 4.6 affiche 15,8 % contre les 2,5 % étonnamment bas de GPT-5.6 Sol. C'est un écart de 6x sur un secteur précis, ce qui se lit soit comme une véritable spécialisation à confirmer, soit comme un benchmark pour lequel GPT-5.6 Sol n'était simplement pas réglé — un examen indépendant serait utile dans les deux cas.

Là où il ne mène pas, c'est sur le groupe classique des agents de codage : DeepSWE, Terminal-Bench, CursorBench, FrontierCode et APEX-SWE vont tous soit à Fable 5, soit à GPT-5.6 Sol. Cela crée une certaine tension avec le cadrage même de l'annonce — « travailler sur une base de code » est explicitement cité comme cas d'usage cible — alors que les chiffres disent que Grok 4.6 est un agent de codage compétent mais pas en tête, et un modèle réellement fort en travail de connaissance et en domaine juridique. L'histoire intéressante de Grok 4.6 est plus étroite et plus précise que ce que « intelligence de frontière » laisse entendre, et aussi plus utile si elle se confirme : un modèle bon pour les tâches de bureau et professionnelles n'est pas une histoire moindre qu'un leader de benchmark de codage, c'en est une différente.

Entraînement : le modèle enseignant les données de son propre successeur

xAI décrit un entraînement complémentaire plus long que celui de 4.5, avec des données générées par modèle et sélectionnées pour le raisonnement et les concepts techniques, plus un optimiseur et une recette améliorés comme fondation pour les étapes SFT/RL. Le détail le plus intéressant : Grok 4.5 a été utilisé pour régénérer les trajectoires SFT de 4.6 — à travers les niveaux d'effort de raisonnement, les harnais d'agents et les domaines — avec un filtrage basé sur un modèle pour éliminer les mauvaises traces. C'est le même motif d'auto-amorçage que nous avons désormais vu chez Meta (Spark 1.1 notant les solutions candidates de Spark 1.2) et implicitement dans le MOPD de Liquid : utiliser la génération précédente comme enseignante des données d'entraînement de la génération suivante, plutôt que de générer uniquement à partir de zéro. Cela devient un geste standard à travers les laboratoires, pas une technique isolée — à suivre comme sa propre tendance.

L'entraînement RL a couvert « un large éventail de tâches RL agentiques » — travail de connaissance, codage général, et environnements spécifiques à un domaine pour l'optimisation de noyaux, le développement web et la CAO. xAI rapporte aussi que Grok 4.6 montre davantage de comportement d'auto-test et de vérification sur les trajectoires longues — « vérifier son propre travail avant de passer à la suite » — ce qui est une affirmation qualitative, non benchmarkée, pas une mesure notée, et qu'il vaut mieux traiter comme telle tant que personne ne la mesure directement.

La section sécurité en dit beaucoup en disant peu

Comparez l'écart de précision : neuf benchmarks de capacité quantifiés avec des scores exacts, contre un paragraphe sécurité qui dit que les garde-fous ont été « améliorés et calibrés en fonction des capacités du modèle », appuyé par « notre suite de tests pré-déploiement la plus large à ce jour » et des « tests post-déploiement et tiers étendus » — pas de chiffres, pas de tiers nommés, pas de résultats d'équipe rouge publiés à côté du tableau détaillé des capacités. Ce n'est pas inhabituel pour un lancement de modèle, mais c'est une vraie asymétrie qui mérite d'être nommée chaque fois qu'elle apparaît : les parties d'une sortie faciles à quantifier ont droit à un tableau, celles difficiles à quantifier ont droit à des adjectifs.

Disponibilité et tarification

Grok 4.6 est disponible dès aujourd'hui dans Cursor, Grok Build, l'API, et des partenaires dont OpenRouter, Vercel et Cloudflare. La tarification reste à 2 $/6 $ par million de tokens en entrée/sortie — inchangée par rapport au tarif de base de Grok 4.5 — avec une variante rapide à un 2x net (4 $/12 $). C'est une structure plus simple que le palier rapide de 4.5, qui tournait à un asymétrique 4 $/18 $ — un vrai changement de structure tarifaire, pas juste une mise à jour de chiffre. Une promotion de première semaine double l'usage inclus dans Grok Build et Cursor. Aucune annonce de poids ouverts n'accompagne cette sortie — la promesse de xAI/SpaceXAI, faite dans le même souffle que son adhésion à l'Open Secure AI Alliance, d'ouvrir un jour les poids de Grok reste non tenue pour la gamme phare à ce lancement.

À surveiller

  • Une vérification indépendante, en particulier sur Harvey LAB. Un écart de 6x sur GPT-5.6 Sol sur un benchmark juridique est soit une véritable spécialisation à confirmer, soit le signe que l'ensemble de comparaison favorise les données d'entraînement de Grok 4.6 d'une manière qui ne se généralisera pas — une évaluation juridique-IA tierce trancherait dans un sens ou dans l'autre.
  • Si « auto-déclaré tiers » reste la norme pour ces tableaux comparatifs. La propre note de bas de page de xAI concède qu'elle cite les chiffres publiés par ses rivaux, pas qu'elle mène des tests tête-à-tête elle-même — un écart méthodologique que chaque laboratoire de cette comparaison partage, et qui garde ces graphiques à un pas de la mesure indépendante.
  • La mesure de l'affirmation d'auto-vérification. « Plus d'auto-test sur les trajectoires longues » est une affirmation comportementale réelle et vérifiable si quelqu'un construit une évaluation pour cela — pour l'instant c'est une anecdote dans un billet de lancement.
  • La promesse de poids ouverts. xAI a rejoint une alliance plaidant pour une IA défensive ouverte et inspectable tout en livrant son modèle phare fermé pour la deuxième sortie consécutive ; l'écart entre cette position déclarée et le schéma de sortie réel de Grok mérite d'être suivi comme sa propre histoire.

Références : xAI — Introducing Grok 4.6 · SpaceXAI sur X — tableau de benchmarks · couverture liée : Grok Bot : le produit qui était depuis le début le vrai objectif du rachat de Cursor · L'Open Secure AI Alliance · Meta Muse Glimmer · Frontier Arcade : tendances et prédictions