Google a livré Gemini 3.7 Flash aujourd'hui, trois semaines après Gemini 3.6 Flash — la même cadence de sortie serrée que nous avons observée chez xAI et DeepSeek cette semaine. Le cadrage de Google est « notre modèle workhorse le plus intelligent à ce jour pour le codage et les agents », le genre de phrase qui ne veut rien dire tant qu'on ne la vérifie pas contre la table comparative publiée par Google en même temps, face à Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra et Muse Spark 1.2.
La table dit quelque chose de plus précis que le titre
Sur 20 benchmarks notés, Gemini 3.7 Flash mène nettement sur neuf — plus qu'aucun des quatre rivaux auxquels il est comparé : FrontierCode 1.1 Main (43,6 % contre 34,4 % pour 3.6), Elo Code Arena en développement web (1588), AutomationBench ensemble privé (30,4 %), Harvey LAB-AA flux juridiques (90,7 %), GDP.pdf compréhension de documents (34,0 %), LVBench vidéo longue (85,4 %), GDM-MRCR v2 long contexte (97,0 %), HLE-Verified (53,6 %), et LABBench2 tâches de recherche en biologie (82,1 %). C'est une colonne de victoires réellement large, pas une paire de catégories triées sur le volet.
Et pourtant, Gemini 3.7 Flash ne mène pas l'Artificial Analysis Intelligence Index — l'unique score composite en haut de la propre table de Google. Il note 56, à égalité pour la dernière place parmi les cinq modèles présentés ; GPT-5.6 Terra et Muse Spark 1.2 notent tous deux 57. C'est l'inverse du motif que nous avions signalé lors du lancement de Grok 4.6, où la mesure composite mise en avant flattait le modèle plus que ne le faisait la table sous-jacente. Ici, le composite le sous-estime : un modèle qui gagne presque la moitié des catégories individuelles de sa propre feuille comparative affiche le score agrégé le plus bas des cinq. Les indices composites font une moyenne sur tout ce dont un modèle est mauvais autant que sur tout ce dont il est bon, et la vraie histoire de Gemini 3.7 Flash est la concentration, pas l'étendue — fort en compréhension de documents, en récupération de long contexte et en flux agentiques précis, plus faible exactement là où il perd.
Où il perd, et c'est un groupe cohérent
GPT-5.6 Terra mène sur six benchmarks, et ils ne sont pas dispersés — ils se regroupent étroitement autour du travail d'agent de codage à long horizon : DeepSWE v1.1 (69,6 % contre 65,3 % pour Gemini 3.7), Terminal-bench 2.1 (87,4 % contre 85,8 %), Terminal-bench 3.0 (20,8 % contre 14,9 %), OSWorld-2.0 usage agentique d'ordinateur (50,2 % contre 47,9 %), CharXiv Reasoning sans outils, et le palier le plus difficile de BioMysteryBench. C'est le même groupe qui est apparu comme la capacité difficile à compresser tout au long du mois — l'exécution soutenue, utilisant des outils, à long horizon, est là où la frontière continue de se séparer du niveau workhorse, quel que soit le laboratoire dont provient ce workhorse. Claude Sonnet 5 prend deux catégories (Agent's Last Exam, palier facile de BioMysteryBench), et — réellement notable — Gemini 3.6 Flash bat son propre successeur sur une mesure étroite, CharXiv Reasoning avec outils (89,4 % contre 88,7 % pour 3.7), un rappel que « plus récent » n'est pas une amélioration stricte sur chaque axe, même au sein de la même famille.
L'affirmation « demi-prix » a besoin d'une précision
Le texte de Google dit que 3.7 Flash sort « à un prix d'introduction de la moitié du coût original de 3.6 Flash par million de tokens » — 0,75 $/3,75 $ contre ce que le billet laisse entendre être le tarif standard de 3.6, 1,50 $/7,50 $ (un chiffre qui correspond à ce que nous avions consigné au lancement de 3.6 Flash). Ce que la table comparative montre réellement, c'est que Gemini 3.6 Flash est actuellement tarifé de façon identique à 3.7 Flash — les deux marqués du même astérisque : c'est un tarif d'introduction pour les deux modèles, expirant le 31 décembre 2026, après quoi les deux reviennent à 1,50 $/7,50 $. Donc le cadrage « demi-prix » est exact par rapport au tarif original de 3.6 avant promotion, mais l'effet pratique aujourd'hui est que Google a discrètement baissé le prix de 3.6 Flash pour qu'il corresponde aussi au prix de lancement de 3.7, plutôt que de ne tarifer agressivement que le nouveau modèle. Les clients existants de 3.6 Flash obtiennent la même remise temporaire que les nouveaux adoptants de 3.7 — à savoir avant de supposer que la baisse de prix est exclusive au nouveau modèle.
L'écosystème produit autour de la table de benchmarks
Quelques détails à noter en dehors des comparaisons notées : Google a fait une démo de 3.7 Flash associé à Nano Banana pour générer un jeu 3D jouable en temps réel à partir d'un prompt texte, et avec Gemini Omni orchestrant des sous-agents pour des pages d'atterrissage interactives en un seul coup — deux produits Google existants intégrés au matériel de lancement de 3.7 Flash plutôt que des affirmations benchmarkées. Une démo de robotique a utilisé « une boucle de graphe à 3 agents » pour aider un robot à apprendre plus vite, le même motif de décomposition multi-agents que nous avons désormais vu dans la répartition Talker/Planner/Perception d'AMIE appliqué à un domaine entièrement différent — un point de données de plus indiquant que découper un agent en sous-agents spécialisés devient une architecture par défaut, pas un choix de recherche isolé.
Plus conséquent : Gemini Spark — l'agent personnel toujours actif que Google avait lancé à l'I/O — tourne désormais sur 3.7 Flash à partir d'aujourd'hui. C'est la même catégorie de produit dans laquelle Grok Bot est entré il y a deux jours : un agent d'arrière-plan persistant agissant pour le compte d'un utilisateur, qui reçoit ici un changement de modèle discret plutôt qu'un lancement à part entière. Il vaut la peine de surveiller la convergence des produits d'agents d'arrière-plan des deux entreprises vers la même cadence de mise à jour — les améliorations de modèle arrivant comme des mises à jour d'infrastructure invisibles pour un produit que l'utilisateur a déjà ouvert, plutôt que comme quelque chose qu'il doit choisir d'adopter.
La section sécurité, une fois de plus, ce sont des adjectifs
Cohérent avec chaque lancement de modèle ce mois-ci, les affirmations de capacité viennent avec des chiffres exacts et les affirmations de sécurité n'en ont pas : « garde-fous mis à jour contre les usages abusifs dans les domaines chimique, biologique, radiologique et nucléaire (CBRN) et de l'offensive cyber », pas de chiffres, pas d'évaluation nommée, un renvoi vers la fiche du modèle plutôt que des données dans le billet lui-même. La même asymétrie que le lancement de Grok 4.6, celui de V4-Pro chez DeepSeek, et pratiquement toute autre sortie de frontière couverte ce mois-ci — à nommer comme le motif qu'elle est clairement devenue plutôt que comme une omission isolée.
À surveiller
- La réplication indépendante des neuf victoires de catégorie, en particulier Harvey LAB-AA et LABBench2 — les benchmarks spécifiques à un domaine en droit et en biologie sont exactement le genre d'affirmation qui mérite d'être vérifiée auprès d'une source extérieure au vendeur avant d'être traitée comme établie.
- Ce qui arrive à la tarification de 3.6 Flash le 1er janvier 2027. Les deux modèles revenant ensemble à 1,50 $/7,50 $ est un engagement réel et daté — savoir si cette date tient, ou est prolongée à la manière dont les promesses de poids ouverts ont dérapé ce mois-ci, mérite d'être vérifié plus tard.
- Le groupe des agents de codage spécifiquement. L'avance de GPT-5.6 Terra sur DeepSWE, Terminal-bench et OSWorld est suffisamment cohérente à travers les laboratoires ce mois-ci pour ressembler moins à l'avantage d'un seul modèle qu'à une frontière de capacité réellement plus dure que le reste de la table.
Références : Google — Introducing Gemini 3.7 Flash · Google — lancement de Gemini 3.6 Flash, pour la référence de prix · couverture liée : Lancement de Grok 4.6 · DeepSeek-V4-Pro · Grok Bot · AMIE (Video) · Frontier Arcade : tendances et prédictions