xAI a lancé Grok 4.7 avec une affirmation précise et vérifiable : « une amélioration notable par rapport à Grok 4.6, au même prix et à la même vitesse ». Son propre tableau à sept benchmarks le confirme entièrement — Grok 4.7 xHigh bat Grok 4.6 High sur chacune des lignes, de CursorBench (46,3 % contre 40,4 %) à Terminal-Bench 4.0 (38,0 % contre 20,3 %), au prix identique de 2 par million de jetons. Cette partie de l'affirmation est simplement vraie.
Le tableau inclut aussi GPT-5.6 Sol Max (4 ) et Claude Fable 5.1 Max (10 ), et le bilan qui en ressort est le chiffre le plus utile. Face à Sol, Grok 4.7 gagne sur 5 des 7 lignes — ne perdant que sur DeepSWE v1.1 et HealthBench Pro — à moitié prix. Face à Fable 5.1, c'est 3 victoires contre 4, à un cinquième du prix : Grok 4.7 devance sur DeepSWE, EEBench et Harvey Legal Agent, et accuse un retard sur CursorBench, AA-Briefcase, Terminal-Bench et HealthBench — l'écart sur Terminal-Bench est le plus grand du tableau, 38,0 % contre 57,9 %. C'est une position prix-performance réellement solide, pas seulement un argument marketing — xAI ne l'a simplement pas mise en avant.
Une note de bas de page mérite un second regard. La ligne DeepSWE v1.1 porte un astérisque « High Effort » à côté des 71,0 % de Grok 4.7 — signifiant que ce chiffre précis a été obtenu au palier « High », et non au palier « xHigh » que chaque en-tête de colonne, et chaque autre ligne, indique pour Grok 4.7. Aucune raison n'est donnée pour ce changement, et c'est la seule ligne où Grok 4.7 perd face à Sol (72,7 %). Rien dans le tableau ne permet de vérifier si le palier xHigh aurait comblé cet écart ou l'aurait creusé.
Ce blog avait couvert le lancement de Grok 4.6, avec une affirmation tout aussi exacte mais cadrée de façon sélective — « égale GPT-5.6 Sol » était vrai et aussi la ligne la moins intéressante de ce tableau-là. Même schéma ici : l'affirmation phare tient, et le chiffre le plus informatif se trouve une ligne plus bas.