2026-08-12

Les poids ouverts de Qwen3.8-Max sont enfin arrivés — en texte seul, et avec deux semaines de retard

AIModels🌍 Asia

La fiche du modèle Hugging Face pour Qwen/Qwen3.8-2.4T-A95B est désormais en ligne, confirmant que c'est bien la sortie ouverte promise du modèle phare de 2,4T de paramètres d'Alibaba — présenté en avant-première le 19 juillet et évalué le 1er août, avec une promesse de poids ouverts « la semaine prochaine » qui aura glissé d'une quinzaine de jours au-delà du délai annoncé. La fiche tranche l'essentiel de ce que ma couverture précédente signalait comme non confirmé — architecture, longueur de contexte, tableau de scores — et fait apparaître un point que la couverture du lancement n'évoquait pas du tout : ce checkpoint ouvert ne traite que du texte.

L'architecture, précisément

Qwen3.8 est un modèle de 2,4 billions de paramètres avec 95 milliards activés par token (confirmant le « A95B » dans son propre nom), construit sur une conception d'attention hybride : 92 couches organisées en 23 blocs répétés, chaque bloc empilant trois couches Gated DeltaNet (attention linéaire) suivies d'une couche Gated Attention (attention complète). Chaque couche est appariée à son propre FFN mixture-of-experts — 512 experts routés au total, avec 10 routés plus 1 partagé actifs par token. Le contexte va jusqu'à 262 144 tokens nativement, extensible à un peu plus de 1 010 000. Il est entraîné avec de la prédiction multi-token (MTP).

Ce rapport de trois pour un entre attention linéaire et attention complète est le même pari architectural que celui popularisé par la Delta Attention de Kimi et repris par la gamme Ling-3.0 d'Ant Group : un traitement du contexte long peu coûteux grâce aux couches d'attention linéaire, ponctué de couches d'attention complète pour empêcher la qualité de recherche d'information de s'effondrer. L'implémentation de Qwen utilise Gated DeltaNet plutôt que KDA spécifiquement, une conception apparentée mais distincte dans la même famille d'attention linéaire. Que trois grands laboratoires chinois convergent vers des architectures hybrides aussi proches à quelques mois d'intervalle en dit plus long sur l'état de l'art en efficacité du contexte long que le score d'un modèle isolé.

Le vrai constat : ouvert, mais pas le modèle phare multimodal

L'avant-première du 19 juillet avait été présentée — y compris dans mes propres articles — comme le premier modèle multimodal de Qwen au-delà du billion de paramètres, acceptant nativement texte, image et vidéo. La fiche des poids réellement publiés dit explicitement le contraire : « Qwen3.8-2.4T-A95B est un modèle en texte seul qui exige le mode réflexion pour toutes les interactions. Les entrées multimodales ne sont pas prises en charge, et la réflexion ne peut pas être désactivée. » Chaque réponse s'ouvre par un raisonnement obligatoire, entre balises <think>, avant toute production : aucun mode sans réflexion vers lequel se replier pour obtenir des réponses rapides et bon marché, et aucune voie vision ou vidéo.

Le tableau de benchmarks de la fiche n'inclut pas non plus les comparaisons multimodales (MMMU-Pro, VideoMME, et le reste) sur lesquelles s'appuyait mon article du 1er août à propos du produit servi par API. L'ensemble de comparaison de cette fiche est Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol (max), et la génération précédente Qwen3.7-Max, uniquement sur des benchmarks de codage, d'agentique et de capacités générales. Les chiffres qui se recoupent correspondent exactement à ce que j'avais rapporté (PaperBench 93,0, IFBench 82,8, HealthBench 60,2, SWE-bench Pro 67,7, HLE 43,6), ce qui nous indique qu'il s'agit de la même génération de modèle sous-jacente. Mais la capacité multimodale qu'Alibaba a démontrée au WAIC semble vivre dans le produit servi par API, et non dans ce checkpoint ouvert. L'écart entre ce qui est vendu et ce qui est ouvert est donc réel et précis — le schéma même que j'ai signalé ailleurs ce mois-ci : le mot « ouvert » désignant un objet plus étroit que le modèle phare commercialisé sous le même nom.

Ce que le tableau de benchmarks montre réellement

En reproduisant le tableau maison de la fiche — le premier regard sur ces chiffres depuis la source primaire plutôt que depuis des comptes rendus secondaires :

BenchmarkOpus 4.8Fable 5GPT-5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
Terminal Bench 2.184,684,688,874,586,6
SWE-bench Pro69,280,064,660,667,7
PaperBench80,388,890,564,893,0
IFBench62,263,572,779,182,8
HealthBench52,4—55,354,560,2
HLE45,753,347,241,443,6
HLE avec outils57,964,558,053,556,2
GPQA Diamond92,092,694,192,492,6
WideSearch72,981,2—75,281,9

Le bond d'une génération à l'autre depuis Qwen3.7-Max est ample et régulier : Terminal Bench 2.1 gagne 12 points, IFBench 3,7, PaperBench 28,2. Dans une comparaison à famille et méthodologie constantes, c'est un signal plus fiable que les lignes qui opposent des laboratoires différents. Face aux modèles extérieurs, le schéma décrit dans mon article du 1er août tient : un vrai leadership sur les benchmarks de suivi d'instructions et de reproduction de recherche (IFBench, PaperBench, WideSearch), une compétitivité sans leadership sur les agents de codage, et la performance relative la plus faible sur HLE, le test de raisonnement général le plus dur de la fiche. La fiche documente en détail ses harnais d'évaluation par benchmark — Claude Code pour la plupart, OpenCode pour l'exécution SkillsBench de la série Qwen — le genre de transparence méthodologique que j'avais portée au crédit de la fiche de Ling-3.0-tiny et qui est réellement utile ici pour la même raison.

Ce qui reste non confirmé

À l'heure où j'écris, la fiche ne nomme aucune licence — Qwen 3.5 et 3.6 sont sortis sous Apache 2.0, et rien ici ne le contredit, mais rien ne le confirme non plus. Reste également invérifié le fait de savoir si Qwen3.8-27B, le petit modèle promis dans la même annonce du 1er août, est sorti dans la même fenêtre. Et savoir si Alibaba compte un jour ouvrir une variante multimodale de Qwen3.8-Max, ou réserver indéfiniment cette capacité à son API, est désormais la question la plus intéressante — davantage que celle par laquelle j'avais commencé.

À surveiller

  • Le texte de la licence. Une licence Apache 2.0 sur un modèle de 2,4 billions de paramètres, fût-il parcimonieux avec 95 milliards actifs, resterait la publication la plus permissive de l'année à cette échelle.
  • Un checkpoint ouvert multimodal sortira-t-il un jour ? C'est l'écart entre la capacité commercialisée et l'objet publié qui fait l'intérêt de cette sortie : si Alibaba n'ouvre jamais la version vision et vidéo, « ouvert » et « phare » seront devenus, sans bruit, deux produits distincts sous un même nom.
  • La reproduction indépendante des chiffres de codage et d'agentique, maintenant que les poids sont réellement téléchargeables et auditables plutôt que verrouillés par API.
  • La réalité du déploiement, déjà signalée ici : 2,4 billions de paramètres au total représentent un engagement d'infrastructure lourd, même avec 95 milliards actifs — et « ouvert » ne veut pas dire « à la portée de la plupart de ceux qui voudraient le faire tourner ».

À lire ensuite