2026-08-01

Qwen3.8-Max a montré son travail — et mène presque tous les classements multimodaux en le faisant

AIBenchmarks🌍 Asia

Il y a deux semaines, Alibaba présentait Qwen3.8-Max en avant-première au WAIC Shanghai avec un chiffre de 2,4 billions de paramètres et une affirmation d'être « juste derrière Fable 5 » — sans rien pour la vérifier : aucun tableau de benchmarks, aucune fiche modèle, aucun nombre de paramètres actifs, aucune licence. C'était, à juste titre, critiqué comme une affirmation sans rien derrière. Cette semaine, les benchmarks sont arrivés, accompagnés d'un tweet de lancement confirmant la tarification et un engagement d'ouverture réellement notable : des poids ouverts pour à la fois Qwen3.8-Max et un nouveau modèle plus petit, Qwen3.8-27B, promis pour la semaine prochaine.

Ce que les tableaux montrent réellement

Sur deux grands tableaux de comparaison face à Claude Opus 4.8, Claude Fable 5, Gemini 3.1 Pro et GPT-5.6 Sol, Qwen3.8-Max ne gagne pas partout — mais là où il gagne, c'est par une marge réelle, et le schéma est précis plutôt que diffus.

Là où il mène nettement : PaperBench (reproduction de recherche) à 93,0, devant les 90,5 de GPT-5.6 Sol et les 88,8 de Fable 5 ; IFBench (suivi d'instructions) à 82,8, loin devant les 72,7 de Sol ; HealthBench à 60,2 contre 55,3 pour Sol ; PLawBench et PRBench-Finance, tous deux menés par Qwen. Et le tableau multimodal est proche d'un balayage complet : MMMU-Pro, MathVision, BabyVision, HiPhO, PhyX, SLAKE, OSWorld-Verified, Parametric CAD Bench, VideoMME, VideoMMMU, MMVU, MLVU — Qwen3.8-Max les domine tous, devant Gemini 3.1 Pro et GPT-5.6 Sol spécifiquement, pas seulement des modèles plus anciens.

Là où ce n'est pas le cas : SWE-bench Pro se situe à 67,7 contre 80,0 pour Fable 5 — un écart de 12 points difficile à lire comme compétitif. FrontierSWE est à 73,5 contre 88,8 pour Fable 5. HLE, le benchmark de raisonnement général le plus difficile de la feuille, est la performance relative la plus faible de Qwen à 43,6 — la plus basse des cinq modèles comparés, derrière même les 45,7 d'Opus 4.8. AndroidWorld et ScreenSpot Pro vont aussi tous deux à Fable 5.

Mis ensemble, c'est une affirmation précise et vérifiable, pas la ligne de classement vague d'il y a deux semaines : Qwen3.8-Max est un véritable leader multimodal et de domaines professionnels, et un agent de codage clairement de second rang derrière Fable 5 spécifiquement. Il vaut la peine de se rappeler qu'il s'agit toujours des propres évaluations internes d'Alibaba, pas d'un classement indépendant comme Artificial Analysis ou LMArena — l'avant-première du 19 juillet avait été critiquée précisément pour cet écart, et publier un tableau complet ne résout pas en soi qui a mené l'évaluation.

La tarification donne un poids réel à l'affirmation multimodale

Qwen3.8-Max est lancé à 2,00 $ en entrée / 6,00 $ en sortie par million de tokens, avec une mise en cache implicite à 0,25 $. Comparé au tableau de tarification que ce blog avait dressé il y a quelques jours : c'est identique à Grok 4.5, moins cher que GPT-5.6 Terra (2 $/12 $) en sortie, et une fraction de GPT-5.6 Sol (5 $/30 $) ou Claude Fable 5 (10 $/50 $) — les deux modèles que Qwen3.8-Max bat justement sur plusieurs des benchmarks multimodaux et de domaines professionnels ci-dessus. Un modèle tarifé au niveau intermédiaire qui mène des modèles de niveau phare sur un ensemble spécifique et réel de benchmarks est une histoire bien plus intéressante que « juste derrière Fable 5 », et c'est celle que les chiffres soutiennent réellement.

Des poids ouverts, deux fois — si la date tient

Le tweet de lancement s'engage à ouvrir les poids à la fois du Qwen3.8-Max complet à 2,4 billions de paramètres et d'un nouveau modèle nettement plus petit, Qwen3.8-27B, « la semaine prochaine ». C'est un pari d'ouverture nettement plus important que ce que la plupart des laboratoires font en une fois — publier les poids d'un modèle à l'échelle phare aux côtés d'un petit modèle déployable dans la même fenêtre donne aux adoptants un véritable choix d'échelle plutôt qu'un téléchargement taille unique. C'est aussi une promesse que ce même modèle a déjà rompue une fois : l'avant-première du 19 juillet disait que les poids ouverts étaient « prévus pour la sortie officielle » sans date, et ce cadrage a glissé pendant deux semaines avant cette publication de benchmarks. Il vaut mieux considérer « la semaine prochaine » comme une date à surveiller, pas une date sur laquelle compter.

Les démonstrations ne sont pas les benchmarks

Le lancement s'appuie aussi sur des anecdotes de capacité qui n'apparaissent dans aucun tableau ci-dessus : « plus de 10 jours de développement auto-évolutif, d'un dossier vide à la production sans intervention humaine », plus de 500 tours d'optimisation autonome de conception de puces, 365 jours de stratégie e-commerce simulée. Ce sont des éléments réels et à surveiller — Alibaba a publié une trace GitHub pour l'affirmation de codage plutôt que de simplement l'affirmer — mais ce sont des démonstrations d'une seule exécution, pas un benchmark noté et reproductible comme le sont PaperBench ou SWE-bench Pro. Gardez-les dans une catégorie mentale distincte des chiffres ci-dessus jusqu'à ce que quelqu'un en dehors d'Alibaba en reproduise une.

À surveiller ensuite

  • Le cadrage « juste derrière Fable 5 » disparaît discrètement du marketing propre de Qwen. Il n'a pas survécu au contact d'un tableau de benchmarks qui montre une histoire bien plus précise et à deux facettes — leader multimodal, agent de codage de second rang — et c'est une ligne plus difficile à mettre sur une diapositive qu'une seule affirmation de classement.
  • Surveillez la date réelle des poids ouverts. Ce modèle a déjà manqué une échéance implicite ; que Qwen3.8-Max et Qwen3.8-27B publient leurs poids ouverts la semaine prochaine, comme promis, est le test qui dira si les autres chiffres de ce lancement méritent le bénéfice du doute.
  • La vérification indépendante du balayage multimodal compte plus que n'importe quel autre chiffre ici. Si Artificial Analysis ou un tiers similaire reproduit ne serait-ce que la moitié des avances vision/vidéo une fois les poids publics, cela devient l'affirmation multimodale à poids ouverts la plus crédible de l'année ; si cela ne se reproduit pas, « propres évaluations internes » faisait plus de travail dans ce tableau que le graphique ne le laisse paraître.

Références : Alibaba Qwen (@Alibaba_Qwen) — annonce de lancement de Qwen3.8-Max · Qwen — article de blog officiel · MarkTechPost — l'avant-première du 19 juillet et le contexte « zéro benchmark » · couverture liée sur ce blog : La guerre des prix que personne ne mène vraiment