2026-08-01

Qwen3.8-Max abat enfin ses cartes — et domine presque tous les classements multimodaux

AIBenchmarks🌍 Asia

Il y a deux semaines, Alibaba présentait Qwen3.8-Max au WAIC de Shanghai avec un chiffre, 2,4 billions de paramètres, et une affirmation : être « juste derrière Fable 5 ». Rien pour l'étayer : aucun tableau de benchmarks, aucune fiche modèle, aucun nombre de paramètres actifs, aucune licence. On avait eu raison d'y voir une déclaration sans preuve. Cette semaine, les benchmarks sont arrivés, avec un tweet de lancement qui confirme les tarifs et un engagement d'ouverture réellement remarquable : les poids seront publiés pour Qwen3.8-Max comme pour un nouveau modèle plus compact, Qwen3.8-27B, dès la semaine prochaine.

Ce que disent vraiment les tableaux

Sur deux grands comparatifs face à Claude Opus 4.8, Claude Fable 5, Gemini 3.1 Pro et GPT-5.6 Sol, Qwen3.8-Max ne gagne pas partout. Mais là où il gagne, l'écart est net, et la répartition des victoires est très lisible.

Là où il domine nettement : PaperBench (reproduction de travaux de recherche) à 93,0, devant les 90,5 de GPT-5.6 Sol et les 88,8 de Fable 5 ; IFBench (respect des instructions) à 82,8, loin devant les 72,7 de Sol ; HealthBench à 60,2 contre 55,3 pour Sol ; PLawBench et PRBench-Finance, remportés eux aussi par Qwen. Côté multimodal, c'est presque une razzia : MMMU-Pro, MathVision, BabyVision, HiPhO, PhyX, SLAKE, OSWorld-Verified, Parametric CAD Bench, VideoMME, VideoMMMU, MMVU, MLVU. Qwen3.8-Max les remporte tous, et pas seulement face à des modèles anciens — devant Gemini 3.1 Pro et GPT-5.6 Sol.

Là où il décroche : SWE-bench Pro plafonne à 67,7 contre 80,0 pour Fable 5, un écart de 12 points qu'on ne peut guère qualifier de compétitif. FrontierSWE affiche 73,5 contre 88,8. HLE, le test de raisonnement général le plus difficile du lot, constitue son plus mauvais résultat relatif, à 43,6 — le dernier des cinq modèles comparés, derrière même les 45,7 d'Opus 4.8. AndroidWorld et ScreenSpot Pro reviennent également à Fable 5.

Mis bout à bout, cela donne une revendication précise et vérifiable, bien loin de la formule floue d'il y a deux semaines : Qwen3.8-Max est un véritable leader multimodal et sectoriel, et un agent de programmation nettement de second rang face à Fable 5. Rappelons toutefois qu'il s'agit encore des évaluations internes d'Alibaba, et non d'un classement indépendant comme Artificial Analysis ou LMArena. L'avant-première du 19 juillet avait précisément été critiquée sur ce point, et publier un tableau complet ne règle pas la question de savoir qui a conduit l'évaluation.

Les tarifs donnent du poids à l'argument multimodal

Qwen3.8-Max est lancé à 2,00 $ en entrée et 6,00 $ en sortie par million de tokens, avec une mise en cache implicite à 0,25 $. Rapporté au tableau de tarifs dressé ici il y a quelques jours, cela le place au niveau de Grok 4.5, en dessous de GPT-5.6 Terra (2 $/12 $) sur la sortie, et à une fraction du prix de GPT-5.6 Sol (5 $/30 $) ou de Claude Fable 5 (10 $/50 $). Ces deux derniers sont justement les modèles que Qwen3.8-Max devance sur plusieurs des benchmarks ci-dessus. Un modèle facturé au tarif du milieu de gamme qui bat des modèles phares sur un ensemble précis et vérifiable de tests, c'est autrement plus intéressant que « juste derrière Fable 5 », et c'est ce que les chiffres soutiennent réellement.

Des poids ouverts, deux fois — si la date tient

Le tweet de lancement promet l'ouverture des poids du Qwen3.8-Max complet, à 2,4 billions de paramètres, et d'un modèle beaucoup plus petit, Qwen3.8-27B, « la semaine prochaine ». L'engagement va plus loin que ce que la plupart des laboratoires font en une seule fois. Publier simultanément un modèle à l'échelle phare et un petit modèle déployable offre aux utilisateurs un vrai choix d'échelle, au lieu d'un téléchargement unique à prendre ou à laisser. C'est aussi une promesse que ce même modèle a déjà rompue : l'avant-première du 19 juillet annonçait des poids ouverts « prévus pour la sortie officielle », sans date, et la formulation a glissé pendant deux semaines avant la publication de ces benchmarks. Mieux vaut donc noter « la semaine prochaine » comme une échéance à surveiller que comme une date sur laquelle compter.

Ne pas confondre démonstrations et benchmarks

Le lancement s'appuie aussi sur des exploits qui ne figurent dans aucun des tableaux ci-dessus : « plus de dix jours de développement auto-évolutif, d'un dossier vide jusqu'à la mise en production sans aucune intervention humaine », plus de 500 cycles d'optimisation autonome de conception de puces, 365 jours de stratégie e-commerce simulée. Ces éléments sont bien réels et méritent d'être suivis, et Alibaba a d'ailleurs publié une trace GitHub pour l'exploit de programmation plutôt que de se contenter de l'affirmer. Mais ce sont des démonstrations en une seule exécution, pas des benchmarks notés et reproductibles comme PaperBench ou SWE-bench Pro. À ranger dans une catégorie à part, tant que personne en dehors d'Alibaba n'en a reproduit un.

À surveiller

  • La disparition discrète du « juste derrière Fable 5 » dans la communication de Qwen. La formule n'a pas résisté à un tableau de benchmarks qui raconte quelque chose de bien plus précis et de bicéphale : leader multimodal, second rôle en programmation. C'est plus dur à faire tenir sur une diapositive qu'une simple ligne de classement.
  • La date effective de publication des poids. Ce modèle a déjà laissé passer une échéance implicite. Que Qwen3.8-Max et Qwen3.8-27B sortent en poids ouverts la semaine prochaine, comme promis, dira si le reste des chiffres de ce lancement mérite le bénéfice du doute.
  • La vérification indépendante de la razzia multimodale, plus importante que n'importe quel autre chiffre. Si Artificial Analysis ou un tiers équivalent reproduit ne serait-ce que la moitié des avances en vision et en vidéo une fois les poids publics, ce sera la revendication multimodale à poids ouverts la plus crédible de l'année. Dans le cas contraire, la mention « évaluations internes » aura porté, dans ce tableau, bien plus de poids que le graphique ne le laisse croire.