2026-09-02

Qwen3.8-Max-0902 devance Claude Fable 5 en face-à-face — et referme presque l'écart avec Opus 5

AIBenchmarks🌍 Asia

Alibaba a lancé Qwen3.8-Max-0902 dans la soirée du 1er septembre 2026, un instantané réajusté de Qwen3.8-Max — présenté en juillet et chiffré en août — post-entraîné spécifiquement pour le code et le travail de bureau. Il s'agit d'une mise à jour disponible uniquement via API : en ligne sur QwenCloud, au même tarif de 2 $/6 $ par million de tokens que la version d'origine (0,17 $ par million de tokens en cas de cache hit explicite, 0,25 $ en cas de cache hit implicite), avec une fenêtre de contexte d'1M de tokens inchangée. Contrairement à l'historique de Qwen3.8-Max lui-même — le modèle sous-jacent avait reçu une sortie en poids ouverts en août, distincte de la version API fermée — cette mise à jour spécifique est fermée uniquement, sans aucune indication sur le fait que ce réajustement axé sur le code atteindra un jour les poids ouverts.

Ce que dit le versionnement lui-même

Il n'y a pas de Qwen 3.9 ici — une refonte de cette ampleur axée sur le code sort sous forme de suffixe daté sur la ligne 3.8 existante plutôt que comme une nouvelle version majeure. Ce n'est pas propre à Qwen ce cycle-ci : Gemini a lancé sa troisième sortie Flash en six semaines sans rebaptiser la gamme, et GPT-5.6 s'est décliné en variantes Sol, Terra et Luna plutôt qu'en une succession numérotée. Les numéros de version décrivent de plus en plus une famille de produits, pas un instantané figé à un instant donné — ce qui fait de « à quel modèle exactement je compare » une question bien réelle pour quiconque lit un tableau de benchmark vieux de quelques semaines à peine.

Devant Fable 5, plus proche qu'attendu d'Opus 5

Alibaba a publié un tableau comparatif sur 17 lignes face à Qwen3.8-Max, Claude Opus 5, Claude Fable 5 et GPT-5.6 Sol, réparti entre Code, Agent et Intelligence multimodale. En calculant le face-à-face avec Claude Fable 5 sur les 16 lignes où les deux modèles sont notés, Qwen3.8-Max-0902 l'emporte 9 fois contre 7 — en tête sur la compréhension de code au niveau du dépôt (SWE-Atlas QnA : 66,3 contre 39,0, l'écart le plus large de tout le tableau), sur la majeure partie de la catégorie Agent (CoWorkBench, JobBench, AutomationBench), et sur la majeure partie de l'Intelligence multimodale (MMMU-Pro, ERQA, BabyVision). Fable 5 tient bon spécifiquement sur les benchmarks de code dynamique les plus difficiles — TerminalBench 3.0, DeepSWE 1.1, NL2Repo-Bench, ProgramBench, SWE-Marathon — où il mène sur les cinq, bien que plusieurs écarts restent inférieurs à un point.

Face à Claude Opus 5, l'écart tient quasiment du pile ou face : Opus 5 remporte 8 des 15 lignes où il dispose d'un score publié. Mais cet avantage n'est pas réparti uniformément — Opus 5 mène sur cinq des huit lignes de Code, nettement sur TerminalBench 3.0 (42,7 contre 29,0) et ProgramBench (41,5 contre 28,0), tandis que Qwen3.8-Max-0902 est en tête ou à égalité partout où Opus 5 dispose bien d'un score en Multimodal (MMMU-Pro, ERQA) et se partage à peu près équitablement les tâches d'Agent. Alibaba ne publie même pas de score Opus 5 pour deux des quatre lignes de Multimodal, ce qui fait reposer cette comparaison catégorielle sur un échantillon plus restreint que les autres.

Cet écart spécifique au code mérite d'être nommé directement : face à Gemini 3.8 Flash et face à Muse Spark 1.3 cette même semaine, Claude Opus 5 était également le seul benchmark qu'aucun des deux rivaux récemment mis à jour n'a pu battre sur les tâches de codage agentique dynamique et difficile en particulier — les évaluations de type TerminalBench et DeepSWE notamment. Trois laboratoires distincts ont mis à jour des modèles face à Opus 5 la même semaine, et tous trois ont buté sur le même mur, dans la même catégorie.

La réserve évidente

C'est le propre tableau d'Alibaba, pas un classement indépendant — Qwen ne choisit pas quelles lignes y figurent, mais elle choisit bien les rivaux de comparaison et la suite de benchmarks. Une ligne, QwenSWEBench V2, est le benchmark interne d'Alibaba elle-même ; Qwen3.8-Max-0902 la remporte, sans surprise. Il convient de considérer l'écart de 9 à 7 face à Fable 5 et le partage quasi égal face à Opus 5 comme un signal réel que cette mise à jour a comblé du terrain, et non comme un classement indépendant confirmé — la même prudence qui s'appliquait au propre tableau de bord de Meta pour Muse Spark 1.3 cette semaine s'applique ici aussi.

À surveiller

  • Une vérification indépendante du face-à-face. Le propre tableau d'Alibaba montre Qwen3.8-Max-0902 devant Fable 5 plus souvent qu'autrement — à vérifier si des agrégateurs tiers comme Artificial Analysis ou LMArena confirment cela une fois qu'ils auront eux-mêmes testé la mise à jour.
  • Si la sortie en poids ouverts reçoit le même traitement. Le checkpoint ouvert publié en août était uniquement textuel et avait pris deux semaines de retard sur la version API — si ce réajustement spécifique au code atteint un jour les poids ouverts, l'écart et le délai méritent tous deux d'être suivis.
  • Si « instantané daté plutôt que changement de version » devient la norme du secteur. Trois laboratoires ont fait une version de cela en une seule semaine — si la prochaine sortie majeure de l'un d'eux saute elle aussi un changement de numéro, c'est un véritable changement dans la façon dont les progrès des modèles sont communiqués, pas un cas isolé.