Qwen a annoncé Qwen3.8-Flash-Next, des poids ouverts décrits comme « un aperçu précoce de l'architecture de Qwen4 », aux côtés d'un modèle de production distinct et pas encore publié appelé Qwen3.8-Flash qui sera tarifé sur l'API QwenCloud à $0,16 par million de tokens en entrée et $0,47 par million en sortie. Deux documents soutiennent la publication en poids ouverts : un rapport technique de 28 pages couvrant l'architecture et le pré-entraînement du modèle de base, et un ensemble distinct de tableaux de benchmarks publiés avec la sortie du modèle, couvrant la performance en aval du checkpoint post-entraîné et multimodal. Ils répondent à des questions différentes, et il vaut la peine de compter chacun selon ses propres termes plutôt que de traiter le résumé du tweet comme l'image complète de l'un ou l'autre.
Le résultat de pré-entraînement : réel, et bien documenté
Le rapport technique — « On the Design of Qwen3.8-Flash-Next Architecture: Evaluation, Efficiency, and Training Stability » — couvre quatre choix de conception avec une véritable profondeur : un brassage de tokens hybride entre Gated DeltaNet (GDN) et attention standard (une couche d'attention complète toutes les quatre, remplacée par Qwen Sparse Attention pendant le pré-entraînement continu), un « Gated Residual » qui élargit le flux résiduel à quatre branches lues via une porte élément par élément, une couche d'embedding par n-grammes dont les tables sont préchargées depuis la mémoire hôte plutôt que de résider sur l'accélérateur, et une recette d'optimiseur Muon réajustée. Le rapport maintient trois axes d'évaluation distincts tout du long — la perte et les benchmarks en aval, le coût d'entraînement/inférence, et la stabilité d'entraînement — et rapporte explicitement les cas où ils se contredisent (élargir le vocabulaire de n-grammes fait baisser la perte de façon monotone tandis que la précision en aval sature ; une variante d'écriture parcimonieuse semblait presque gratuite en perte de pré-entraînement et ne s'est dégradée que plus tard). Ce genre de transparence sur les endroits où les propres métriques d'un laboratoire se contredisaient mérite d'être crédité directement.
En comptant le tableau 11 directement : Flash-Next-Base (125 milliards de paramètres au total, 6 milliards actifs, plus 51 milliards de paramètres de tables d'embedding par n-grammes maintenues hors accélérateur) bat le plus petit Qwen3.8-27B-Base sur les 14 benchmarks de pré-entraînement, et face au bien plus grand Qwen3.7-Plus-Base (397 milliards au total, 17 milliards actifs), il mène sur 8 et accuse un retard sur les 6 restants d'au plus 2,6 points — tout en utilisant environ un tiers des paramètres actifs, un tiers des tokens d'entraînement, et environ un neuvième des FLOPs d'entraînement. Qwen Sparse Attention suit la perte d'entraînement de l'attention complète à environ 1×10⁻⁴ près tout en tournant 7,6 fois plus vite en préremplissage et 4,9 fois plus vite en décodage à un contexte d'1 million de tokens, au niveau du noyau de calcul ; la bibliothèque de noyaux FlashQLA offre une accélération de 2 à 3 fois à la passe avant et d'environ 2 fois à la passe arrière par rapport à la référence Triton existante. C'est une affirmation d'efficacité réelle et précise sur le modèle de base, étayée par des chiffres plutôt que des adjectifs.
Les tableaux de benchmarks du modèle post-entraîné : globalement vrais, avec trois exceptions précises
Séparément, Qwen a publié des tableaux de benchmarks comparant Qwen3.8-Flash-Next à Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, et Claude-Opus-4.6 (Max) sur des catégories de codage, d'agentivité, de raisonnement général et de multimodalité — avec de vraies notes méthodologiques attachées à presque chaque ligne : harnais divulgués (Claude Code, mini-SWE-agent), réglages de température/top_p/contexte divulgués, un modèle juge divulgué par benchmark le cas échéant (GPT-4o pour HLE, une version datée de Claude Code pour Vision2Web), une note explicite selon laquelle « les tâches problématiques ont été corrigées et tous les modèles de référence ont été réévalués sur le benchmark corrigé » pour SWE-bench Pro plutôt que de comparer une nouvelle exécution à d'anciens chiffres de référence, et une contre-mesure anti-triche précise pour NL2Repo-Bench (désactivation des commandes Bash qui pourraient récupérer ou cloner directement le dépôt cible). C'est une divulgation véritablement plus rigoureuse que celle de la plupart des tableaux de benchmarks auto-publiés, et cela mérite d'être nommé comme tel — avec une réserve qui mérite d'être signalée clairement : deux des benchmarks (CoWorkBench, RecreationBench) sont décrits comme internes, ce qui signifie que Qwen a construit le test sur lequel elle se note elle-même, ce qui mérite plus de scepticisme qu'un benchmark maintenu de façon externe.
En comptant les deux tableaux directement — 22 lignes de benchmarks au total (12 dans le tableau codage/agent/général, 10 dans le tableau multimodal) — Qwen3.8-Flash-Next affiche le meilleur score, ou un score à égalité avec le meilleur, sur 20 d'entre elles. La formulation du tweet était que Flash-Next surpasse Qwen3.7-Plus « sur tous les tableaux » — ce n'est pas tout à fait ce que montrent les tableaux une fois chaque ligne vérifiée plutôt que les cinq chiffres phares. Deux lignes reviennent entièrement à un autre modèle : DeepSeek-V4-Flash-0731 remporte NL2Repo-Bench sans partage (54,2 contre 48,1 pour Flash-Next), et Claude-Opus-4.6 (Max) remporte HLE, le benchmark de raisonnement général le plus difficile des deux tableaux (40,0 contre 35,9 pour Flash-Next). Deux autres lignes se partagent entre sous-métriques : sur Agents' Last Exam, DeepSeek devance Flash-Next sur le chiffre Pass@1 (25,2 contre 24,3) tandis que Flash-Next mène sur la métrique Score distincte du même benchmark (51,2, aucun score DeepSeek rapporté) ; et sur CharXiv, Qwen3.7-Plus lui-même — le modèle que Flash-Next est censé battre « sur tous les tableaux » — mène sans invite de chaîne de raisonnement (85,8 contre 84,6), tandis que Flash-Next reprend l'avantage une fois la chaîne de raisonnement autorisée (90,6 contre 85,9). Aucune de ces exceptions ne renverse le tableau d'ensemble — 20 sur 22 est un résultat solide — mais elles constituent une correction précise et utile à une affirmation générale, et elles suivent un schéma qui mérite d'être noté en soi : les pertes de Flash-Next se regroupent sur la ligne de raisonnement pur la plus difficile (HLE) et sur des sous-métriques techniques étroites, pas sur les larges catégories d'agentivité et de codage où son avance est la plus grande et la plus constante.
La stabilité d'entraînement, créditée clairement
Un dernier résultat qui mérite d'être nommé, tiré du rapport technique : Qwen déclare que l'entraînement à pleine échelle de Qwen3.8-Flash-Next s'est déroulé « sans un seul pic de perte ni fluctuation anormale des normes de gradient », sans avoir besoin d'astuces de stabilisation explicites comme qk-clip ou SwiGLU-clip qu'utilisent d'autres laboratoires (dont l'équipe de Kimi, citée directement dans le rapport) pour contrôler l'instabilité d'entraînement. Cette affirmation est étayée par une vraie mise à l'épreuve — faire tourner l'entraînement à quatre fois le taux d'apprentissage optimal et montrer que la nouvelle recette reste stable là où l'architecture précédente présente des pics — plutôt qu'affirmée telle quelle.
À surveiller
- Une évaluation indépendante des poids publiés. Les chiffres de pré-entraînement comme de post-entraînement sont propres à Qwen ; qu'un tiers fasse tourner sa propre suite sur le checkpoint téléchargeable est ce qui confirmerait que le score de 20 sur 22 et les exceptions précises tiennent en dehors des choix de harnais propres à Qwen.
- Les benchmarks internes en particulier. CoWorkBench et RecreationBench sont des constructions propres à Qwen ; la reproduction indépendante compte davantage pour ces deux lignes que pour les benchmarks maintenus de façon externe dans les mêmes tableaux.
- La sortie du Qwen3.8-Flash de production, et la concordance de ses scores avec ceux de Flash-Next. Les deux ont été annoncés ensemble sous des noms qui prêtent à confusion ; reste à vérifier, une fois la version tarifée et fermée disponible, si elle affiche bien les mêmes chiffres que l'aperçu en poids ouverts.
Références : Qwen (@Alibaba_Qwen) sur X — annonce · Rapport technique — On the Design of Qwen3.8-Flash-Next Architecture · GitHub — QwenLM/Qwen3.8-Flash-Next · Hugging Face — Qwen/Qwen3.8-Flash-Next · couverture liée : Les poids ouverts de Qwen3.8-27B · Les poids ouverts de Qwen3.8-Max sont enfin arrivés · Frontier Arcade : tendances et prédictions