2026-08-12

Les poids ouverts de Qwen3.8-Max sont enfin arrivés — en texte seul, et avec deux semaines de retard

AIModels🌍 Asia

La fiche du modèle Hugging Face pour Qwen/Qwen3.8-2.4T-A95B est désormais en ligne, confirmant ce que nous ne pouvions qu'inférer du nom du dépôt dans notre premier passage sur cette histoire : c'est bien la sortie ouverte promise du modèle phare de 2,4T de paramètres d'Alibaba, présenté en préversion le 19 juillet et testé le 1er août avec une promesse de poids ouverts « la semaine prochaine » qui a dérapé d'environ deux semaines au-delà de son propre délai. La fiche résout la plupart de ce que nous avions signalé comme non confirmé — architecture, longueur de contexte, table de benchmarks — et fait apparaître quelque chose que la couverture du lancement précédent ne mentionnait pas du tout : ce checkpoint ouvert est en texte seul.

L'architecture, précisément

Qwen3.8 est un modèle de 2,4 billions de paramètres avec 95 milliards activés par token (confirmant le « A95B » dans son propre nom), construit sur une conception d'attention hybride : 92 couches organisées en 23 blocs répétés, chaque bloc empilant trois couches Gated DeltaNet (attention linéaire) suivies d'une couche Gated Attention (attention complète), chaque couche étant appariée à son propre FFN mixture-of-experts — 512 experts routés au total, avec 10 routés plus 1 partagé actifs par token. Le contexte va jusqu'à 262 144 tokens nativement, extensible à un peu plus de 1 010 000. Il est entraîné avec de la prédiction multi-token (MTP).

Ce ratio 3:1 d'attention linéaire à complète est le même pari architectural que la Delta Attention de Kimi a popularisé et que la gamme Ling-3.0 d'Ant Group a adoptée — une modélisation de long contexte bon marché grâce aux couches d'attention linéaire, des couches d'attention complète périodiques pour empêcher la qualité de récupération de s'effondrer. L'implémentation de Qwen utilise Gated DeltaNet plutôt que KDA spécifiquement, une conception apparentée mais distincte dans la même famille d'attention linéaire. Trois grands laboratoires chinois convergeant vers des hybrides structurellement similaires à quelques mois d'intervalle est un signal plus fort sur l'endroit où le domaine a atterri en matière d'efficacité de long contexte que le score de benchmark d'un seul modèle.

Le vrai constat : ouvert, mais pas le modèle phare multimodal

La préversion du 19 juillet avait été rapportée — y compris dans notre propre couverture antérieure — comme le premier modèle multimodal de Qwen au-dessus de 1T de paramètres, avec entrée native texte, image et vidéo. La fiche du modèle pour les poids réellement ouverts dit le contraire, explicitement : « Qwen3.8-2.4T-A95B est un modèle en texte seul qui exige le mode réflexion pour toutes les interactions. Les entrées multimodales ne sont pas prises en charge, et la réflexion ne peut pas être désactivée. » Chaque réponse commence par un raisonnement obligatoire entre balises <think> avant toute sortie — il n'y a pas de mode sans réflexion vers lequel se replier pour des réponses bon marché et rapides, et aucune voie vision ou vidéo du tout.

La table de benchmarks de la fiche n'inclut pas non plus les comparaisons multimodales (MMMU-Pro, VideoMME, et le reste) qui ancraient notre couverture du 1er août sur le produit servi via API — l'ensemble de comparaison de cette fiche est Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol (max), et la génération précédente Qwen3.7-Max, uniquement sur des benchmarks de codage, d'agentique et de capacités générales. Les chiffres qui se recoupent correspondent exactement à notre couverture antérieure (PaperBench 93,0, IFBench 82,8, HealthBench 60,2, SWE-bench Pro 67,7, HLE 43,6), ce qui nous indique qu'il s'agit de la même génération de modèle sous-jacente — mais la capacité multimodale qu'Alibaba a démontrée au WAIC semble vivre dans le produit servi par API et non dans ce checkpoint ouvert. C'est un écart réel et précis entre ce qui est vendu et ce qui est ouvert, dans la même forme que nous avons signalée ailleurs ce mois-ci : « ouvert » décrivant un artefact plus étroit que le modèle phare commercialisé sous le même nom.

Ce que la table de benchmarks montre réellement

En reproduisant la propre table de la fiche, puisque c'est le premier regard réellement indépendant du sourçage secondaire que nous ayons eu :

BenchmarkOpus 4.8Fable 5GPT-5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
Terminal Bench 2.184,684,688,874,586,6
SWE-bench Pro69,280,064,660,667,7
PaperBench80,388,890,564,893,0
IFBench62,263,572,779,182,8
HealthBench52,455,354,560,2
HLE45,753,347,241,443,6
HLE avec outils57,964,558,053,556,2
GPQA Diamond92,092,694,192,492,6
WideSearch72,981,275,281,9

Le bond générationnel depuis Qwen3.7-Max est large et cohérent — Terminal Bench 2.1 en hausse de 12 points, IFBench de 3,7, PaperBench de 28,2 — ce qui est le signal le plus fiable dans une comparaison de même famille et même méthodologie que les lignes inter-laboratoires. Face aux modèles extérieurs, le motif de notre couverture du 1er août tient : un vrai leadership sur les benchmarks de suivi d'instructions et de reproduction de recherche (IFBench, PaperBench, WideSearch), une compétitivité sans leadership sur les agents de codage, et la performance relative la plus faible sur HLE, le test de raisonnement général le plus dur de la fiche. La fiche documente en détail ses harnais d'évaluation par benchmark — Claude Code pour la plupart, OpenCode pour l'exécution SkillsBench de la série Qwen — le genre de divulgation méthodologique que nous avions créditée à la fiche de Ling-3.0-tiny et qui est réellement utile ici pour la même raison.

Ce qui reste non confirmé

La fiche ne nomme aucune licence dans les sections qui nous sont accessibles — Qwen 3.5 et 3.6 sont sortis sous Apache 2.0, et rien ici ne le contredit, mais rien ne le confirme non plus. Si Qwen3.8-27B, le petit frère promis dans la même annonce du 1er août, est sorti dans la même fenêtre reste non vérifié. Et si Alibaba prévoit d'ouvrir un jour une variante multimodale de Qwen3.8-Max, ou garde cette capacité API uniquement indéfiniment, est maintenant la question ouverte la plus intéressante par rapport à celle par laquelle nous avions commencé.

À surveiller

  • Le texte de la licence. Apache 2.0 sur un véritable modèle de 2,4T, même parcimonieux à 95B actifs, resterait la sortie à grande échelle la plus permissive de l'année.
  • Si un checkpoint ouvert multimodal sort un jour. L'écart entre la capacité commercialisée et l'artefact ouvert est la vraie histoire ici — si Alibaba n'ouvre jamais la version vision/vidéo, « ouvert » et « phare » sont devenus discrètement deux produits différents sous un même nom.
  • La reproduction indépendante des chiffres de codage et d'agentique, maintenant que les poids sont réellement téléchargeables et auditables plutôt que verrouillés par API.
  • La réalité du déploiement, comme nous l'avions signalé auparavant : 2,4T de paramètres au total est un engagement d'infrastructure sérieux même à 95B actifs, et « ouvert » ne veut pas dire « faisable par la plupart de ceux qui voudraient le faire tourner ».

Références : Hugging Face — fiche du modèle Qwen/Qwen3.8-2.4T-A95B · MarkTechPost — la préversion du 19 juillet · couverture liée : Qwen3.8-Max en préversion avec zéro benchmark · Qwen3.8-Max a montré son travail · Ling-3.0-tiny · Les niveaux d'ouverture · Des poids ouverts que vous ne pouvez pas vraiment faire tourner · Frontier Arcade : tendances et prédictions