2026-08-14

Qwen3.8-27B : un modèle de 27B qui bat un modèle 30 fois plus grand sur la plupart de ses propres comparaisons

AIOpen SourceModels🌍 Asia

L'équipe Qwen d'Alibaba a publié les poids ouverts de Qwen3.8-27B — un modèle dense, nativement multimodal, sous licence Apache 2.0, avec un contexte natif de 262K tokens extensible à environ 1M grâce à YaRN. C'est un petit modèle au regard des standards du mois, et c'est précisément ce qui rend ses tableaux de benchmarks intéressants à lire de près : Alibaba soutient qu'un modèle de 27 milliards de paramètres tient tête à des modèles fermés de pointe des dizaines de fois plus gros, et les bat le plus souvent.

Lire le tableau codage, agents et raisonnement général en comptant les victoires

Le tableau comparatif d'Alibaba (Qwen3.8-27B face à Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B de Meta et Claude Opus 4.6 Max) couvre neuf benchmarks de codage, d'agentivité et de raisonnement général. Le décompte est vite fait : Qwen3.8-27B l'emporte en confrontation directe sur huit des neuf — SWE-bench Pro (61,7), QwenSWEBench (79,0), CoWorkBench (70,7), JobBench (33,4), Agents' Last Exam (42,9), IFBench (79,5) et LiveCodeBench v6 (90,3), plusieurs avec de larges marges sur son prédécesseur Qwen3.6-27B. Opus 4.6 Max remporte les quatre autres : Terminal Bench 2.1 (78,2 contre 73,0), NL2Repo-Bench (47,6 contre 42,3), GPQA Diamond (91,3 contre 89,2) et HLE (40,0 contre 30,8). La répartition est donc précise, et non une domination d'ensemble : des performances solides, souvent en tête, sur les benchmarks d'agents de codage et de travail de bureau réel. L'écart avec les modèles fermés de pointe se creuse précisément sur les évaluations de raisonnement pur les plus difficiles — HLE avant tout, où Opus 4.6 Max devance de près de dix points. Qu'un modèle de 27 milliards de paramètres rivalise avec un modèle réputé trente fois plus gros, et le batte le plus souvent dans ses catégories de prédilection, reste néanmoins un résultat d'efficacité remarquable, quels que soient les domaines où il reste distancé.

Le tableau multimodal, ou les limites du « surpasse Qwen3.7-Plus dans l'ensemble »

Sur le tableau multimodal à treize benchmarks, Qwen3.8-27B l'emporte nettement sur le versant agentique et incarné : pilotage d'ordinateur (OSWorld-Verified, 84,3), de navigateur (WebArena, 64,8) et de mobile (AndroidWorld, 81,9), recréation d'application (47,1), ingénierie logicielle multimodale (SWE-MM, 38,6), développement web à partir d'une maquette (Vision2Web, 62,9), ainsi que les lignes de raisonnement visuel général et de mathématiques visuelles avec chaîne de pensée activée. Mais Qwen3.7-Plus — un grand frère de la génération courante, pas un modèle dépassé — l'emporte sur la compréhension de documents (OmniDocBench, 91,4), la perception du monde réel (RealWorldQA, 86,9), l'intelligence incarnée (ERQA, 69,8) et la moyenne de ClawEval-MM. Le texte de lancement d'Alibaba présente pourtant Qwen3.8-27B comme un modèle qui « surpasse Qwen3.7-Plus dans l'ensemble » : exact comme moyenne, mais à confronter au détail ligne par ligne. Ce n'est pas une victoire par forfait, c'est un vrai compromis de capacités — et ce « dans l'ensemble » opère le même genre de compression que j'ai signalé ce mois-ci dans la présentation d'autres modèles phares.

Ce qui reste auto-rapporté

Tous les chiffres ci-dessus proviennent du tableau comparatif d'Alibaba : ils sont produits par l'éditeur, sans vérification indépendante, et la fiche du modèle ne mentionne aucune reproduction par un tiers. Mieux vaut le dire clairement que de reprendre ces scores comme des faits établis, d'autant que Qwen3.8-27B revendique la victoire sur la quasi-totalité de ses propres comparaisons. Reste que les poids sont ouverts et sous licence Apache 2.0 : la reproduction indépendante est désormais possible, et un modèle dense de 27 milliards de paramètres est assez petit pour que des laboratoires extérieurs, voire des chercheurs isolés, puissent réellement le faire tourner et le vérifier.

À surveiller

  • La reproduction indépendante des benchmarks. Un modèle dense de 27 milliards de paramètres se vérifie directement sans moyens démesurés : c'est exactement l'épreuve dont cette série d'affirmations a besoin.
  • L'écart sur HLE et GPQA en particulier. L'avance d'Opus 4.6 Max sur ces deux tests laisse penser que cette génération de Qwen est fortement optimisée pour l'agentivité, le codage et le travail de bureau, au prix des épreuves de raisonnement général les plus ardues. Reste à savoir s'il s'agit d'un arbitrage délibéré ou d'un véritable plafond de capacité.
  • L'adoption pour des applications multimodales légères, déployables en local. Alibaba positionne explicitement ce format pour des développeurs qui installent leurs applications sur leur propre matériel plutôt que de passer par une API : ce qui sera construit avec sera le vrai juge de paix.

À lire ensuite