L'équipe Qwen d'Alibaba a publié en poids ouverts Qwen3.8-27B — un modèle dense, multimodal natif, sous licence Apache 2.0, avec un contexte natif de 262K extensible à environ 1M de tokens via YaRN. C'est un petit modèle selon les standards de ce mois-ci, et c'est précisément ce qui rend ses propres tableaux de benchmarks intéressants à lire de près : Alibaba affirme qu'un modèle de 27B rivalise avec, et bat le plus souvent, des modèles fermés de pointe des dizaines de fois plus grands.
Lire le tableau codage/agent/général en comptant les victoires
Le propre tableau comparatif d'Alibaba (Qwen3.8-27B face à Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B de Meta, et Claude Opus 4.6 Max) couvre neuf benchmarks de codage, d'agentivité et de raisonnement général. En comptant directement : Qwen3.8-27B gagne huit des neuf catégories en direct — SWE-bench Pro (61,7), QwenSWEBench (79,0), CoWorkBench (70,7), JobBench (33,4), Agents' Last Exam (42,9), IFBench (79,5), et LiveCodeBench v6 (90,3), plusieurs avec de larges marges face à son propre prédécesseur Qwen3.6-27B. Opus 4.6 Max gagne les quatre autres : Terminal Bench 2.1 (78,2 contre 73,0), NL2Repo-Bench (47,6 contre 42,3), GPQA Diamond (91,3 contre 89,2), et HLE (40,0 contre 30,8). Le motif est précis, pas une domination générale : une performance forte, souvent en tête, sur les benchmarks d'agents de codage et de travail de bureau réel, avec l'écart face aux modèles fermés de pointe qui se creuse spécifiquement sur les évaluations de raisonnement pur les plus difficiles — HLE en premier lieu, où Opus 4.6 Max mène de près de dix points. Qu'un modèle de 27B paramètres rivalise avec, et batte le plus souvent, un modèle rapporté comme 30 fois plus grand sur ses catégories les plus fortes est un résultat d'efficacité réellement notable, peu importe où il reste en retrait.
Le tableau multimodal, et là où « surpasse Qwen3.7-Plus globalement » s'amincit
Sur le tableau multimodal à 13 benchmarks, Qwen3.8-27B gagne de façon décisive du côté agentique et incarné — utilisation d'ordinateur (OSWorld-Verified, 84,3), utilisation de navigateur (WebArena, 64,8), utilisation mobile (AndroidWorld, 81,9), recréation d'application (47,1), ingénierie logicielle multimodale (SWE-MM, 38,6), développement web visuel (Vision2Web, 62,9), et les lignes de raisonnement visuel général et mathématique visuel avec chaîne de pensée activée. Mais Qwen3.7-Plus — un grand frère actuel, pas une génération dépassée — gagne l'intelligence documentaire (OmniDocBench, 91,4), la perception du monde réel (RealWorldQA, 86,9), l'intelligence incarnée (ERQA, 69,8), et le score moyen de ClawEval-MM. Le propre texte de lancement d'Alibaba qualifie Qwen3.8-27B de modèle qui « surpasse Qwen3.7-Plus globalement » — vrai en tant qu'affirmation composite, et à lire face à la répartition réelle ligne par ligne : ce n'est pas un balayage net, c'est un vrai compromis de capacités, et « globalement » fait le même genre de travail de compression que nous avons signalé dans les cadrages phares d'autres laboratoires ce mois-ci.
Ce qui reste auto-rapporté
Chaque chiffre ci-dessus provient du propre tableau comparatif d'Alibaba — géré par le vendeur, pas vérifié indépendamment, et la fiche du modèle ne précise aucune reproduction tierce de ces résultats. Cela vaut la peine de le dire clairement plutôt que de répéter les chiffres comme un fait établi, d'autant plus vu à quel point Qwen3.8-27B affirme gagner la plupart de ses propres comparaisons. Les poids étant ouverts et sous licence Apache 2.0, la reproduction indépendante est au moins possible maintenant — un modèle dense de 27B est assez petit pour que des laboratoires externes et des chercheurs individuels puissent réellement l'exécuter et le vérifier.
À surveiller
- La reproduction indépendante des benchmarks. Un modèle dense de 27B est une taille réaliste à vérifier directement, exactement le test dont ce jeu d'affirmations a besoin.
- L'écart sur HLE et GPQA spécifiquement. L'avance d'Opus 4.6 Max là-dessus suggère que cette génération de Qwen est fortement optimisée pour les benchmarks agentiques/codage/travail de bureau, au prix possible des tests de raisonnement général les plus difficiles — à surveiller pour savoir s'il s'agit d'un compromis délibéré ou d'un vrai plafond de capacité.
- L'adoption pour des applications multimodales légères et déployables localement — le propre cadrage d'Alibaba positionne cette taille spécifiquement pour des développeurs qui déploient des applications localement plutôt que via une API, et le vrai test de ce pari est ce qui sera construit avec.
Références : Qwen (@Alibaba_Qwen) sur X — annonce · Hugging Face — collection Qwen3.8 · couverture liée : Qwen3.8-Max a montré son travail · Les poids ouverts de Qwen3.8-Max sont enfin arrivés · Cinq jours après avoir fermé Muse Spark, Meta annonce le rouvrir · Sortie de Grok 4.6 · Frontier Arcade : tendances et prédictions