2026-08-26

GLM-5.3-Flash était Ox Alpha depuis le début — et « proche d'Opus 4.8 » sous-estime deux autres modèles

AIModelsOpen Source🌍 Asia

Z.ai a publié GLM-5.3-Flash — le premier modèle nativement multimodal de la série GLM-5, 320 milliards de paramètres au total dont 18 milliards actifs, sous licence MIT — et a confirmé quelque chose que ce blog suivait sans réponse définitive : « Avant sa sortie, nous avons testé GLM-5.3-Flash de façon anonyme sous le nom ox-alpha sur OpenCode et OpenRouter pour recueillir les retours des utilisateurs. » C'est une confirmation directe, venant du laboratoire lui-même, de ce que l'identification par comptage de tokens et une trace de pile issue d'une requête malformée pointaient il y a quelques semaines : le modèle furtif et anonyme gratuit « Ox Alpha », devenu un jeu de devinette sur X, était ce modèle, testé sous un pseudonyme avant son lancement nommé. Il vaut la peine de clore cette boucle clairement plutôt que de la laisser en réserve : la question d'identité que ce billet traitait comme une hypothèse principale non confirmée est désormais tranchée.

Ce qui a réellement été publié

GLM-5.3-Flash introduit une architecture d'attention hybride — attention parcimonieuse et linéaire combinées, visant spécifiquement à réduire le coût du service à long contexte tout en préservant la précision à long contexte — plus une technique que Z.ai appelle Manifold-Constrained Hyper-Connections (mHC) pour l'efficacité de mise à l'échelle, et IndexPool, qui compresse quatre vecteurs clés d'indexeur en un seul via un pooling pondéré pour réduire la latence et la surcharge mémoire de l'indexeur jusqu'à un contexte d'1 million de tokens. Il est entraîné sur un corpus de pré-entraînement multimodal de 30 000 milliards de tokens et publié sous licence MIT — notamment pas Apache 2.0, que les autres sorties récentes GLM-5.x de Z.ai ont utilisée, ce qui mérite d'être signalé comme une différence de conditions petite mais réelle.

Un décorticage indépendant apporte une précision que le billet de Z.ai n'a pas

Sebastian Raschka — un pédagogue en ML qui tient une « LLM Architecture Gallery » comparant comment les laboratoires construisent leurs modèles — a publié un décorticage indépendant nommant les composants réels derrière la description générique « attention parcimonieuse et linéaire » de Z.ai : 34 couches de Kimi Delta Attention (KDA, propre à Moonshot/Kimi), aux côtés de 11 couches combinant Multi-head Latent Attention et DeepSeek Sparse Attention (MLA/DSA, propres à DeepSeek), dans un ratio « super hybride » de 3:1 — inhabituel car Kimi et DeepSeek associent chacun leur propre variante d'attention efficace à de l'attention complète standard, tandis que GLM-5.3-Flash empile les conceptions nommées de deux autres laboratoires ensemble. Il attribue aussi le mécanisme résiduel « Manifold-Constrained Hyper-Connections » (mHC) à une conception de style DeepSeek V4 à quatre flux plutôt qu'à un original de Z.ai, et fournit des spécifications que le blog de l'éditeur ne publie pas directement : 45 couches au total, un vocabulaire de 155k, et seulement 18 des 320 milliards de paramètres totaux — 5,6 % — actifs par token. Il vaut la peine de le signaler clairement : c'est la reconstruction crédible d'un analyste extérieur, pas la spécification confirmée de Z.ai elle-même.

Diagramme d'architecture de GLM-5.3-Flash par Sebastian Raschka : 45 couches alternant 34 couches KDA et 11 couches MLA+DSA, des connexions résiduelles mHC à quatre flux parallèles, et un bloc MoE parcimonieux avec 1 expert partagé et 8 experts routés activant 18 des 320 milliards de paramètres par token. Reconstruction architecturale indépendante par Sebastian Raschka, pas un diagramme officiel de Z.ai.

L'affirmation d'efficacité, et celle que Z.ai a divulguée contre elle-même

Comparé au GLM-5.3 en taille complète, Z.ai rapporte un calcul d'attention 3,0 fois plus faible et un cache KV 4,4 fois plus petit pour GLM-5.3-Flash — une affirmation architecturale précise et vérifiable. Ce qui mérite d'être crédité directement, c'est ce que Z.ai divulgue volontairement juste à côté de ce chiffre : le cache KV de GLM-5.3-Flash reste plus grand que ceux de Kimi-K3 et DeepSeek-V4-Flash, décrit dans son propre compte-rendu comme « laissant encore de la marge d'amélioration ». C'est un laboratoire qui divulgue où sa propre architecture reste en retard sur ses concurrents dans le même souffle que sa victoire d'efficacité phare — ce qui mérite d'être nommé comme une vraie transparence plutôt qu'une note de bas de page à ignorer.

Séparément, sur l'Artificial Analysis Intelligence Index v4.1.1 — un agrégateur de benchmarks géré de façon indépendante, pas une construction de Z.ai — GLM-5.3-Flash obtient un score de 57 pour $0,045 par tâche (tarif réduit), ce que Z.ai présente comme un niveau d'intelligence « auparavant disponible seulement à environ 10 fois ce coût ». C'est un vrai point de donnée tiers derrière l'argument d'efficacité de coût, distinct des propres tableaux de benchmarks de l'éditeur ci-dessous.

Le tableau de benchmarks, compté directement

La formulation de Z.ai : GLM-5.3-Flash « surpasse GLM-5.2 sur les benchmarks et les charges de travail réelles à un dixième du prix, tout en s'approchant de Claude Opus 4.8 sur les benchmarks de codage et d'agentivité ». En comptant le tableau publié à 14 lignes directement, avec le gagnant de chaque ligne en gras :

BenchmarkGLM-5.3-FlashGLM-5.2DeepSeek-V4-Vision-ExpOpus 4.8GPT-5.6 TerraGemini 3.7 Flash
Terminal Bench 2.184,381,083,985,087,485,8
DeepSWE v1.163,446,259,358,069,665,3
NL2Repo56,348,957,769,7
Toolathlon Verified78,459,975,976,274,9
AutomationBench v1.0.648,826,238,841,037,252,3
Agents' Last Exam26,320,427,327,028,0
HLE w/ Tools55,354,755,157,9
GDPval-AA v2177315041675158215711527
OfficeQA Pro62,457,948,9
CharXiv Reasoning w/ Tools89,480,489,988,088,7
Chartography w/ Tools78,064,375,068,065,0
BabyVision53,435,146,861,670,9
MVbench77,869,467,175,082,2
MMVU80,572,767,475,882,3

La première moitié de l'affirmation de Z.ai tient pleinement : GLM-5.3-Flash bat GLM-5.2 sur chaque ligne où GLM-5.2 a un score rapporté, plusieurs fois par de larges marges (DeepSWE v1.1 : 63,4 contre 46,2 ; AutomationBench : 48,8 contre 26,2). La seconde moitié est là où le tableau complique le titre. GLM-5.3-Flash gagne franchement sur 4 des 14 lignes ; Opus 4.8 en gagne 3. Mais deux modèles que le texte de Z.ai ne met pas en avant gagnent en réalité plus de lignes que l'une ou l'autre moitié de cette paire : GPT-5.6 Terra en gagne 3 (Terminal Bench 2.1, DeepSWE v1.1, Agents' Last Exam), et Gemini 3.7 Flash en gagne 4 (AutomationBench, BabyVision, MVbench, MMVU) — autant de victoires franches que GLM-5.3-Flash lui-même, et plus qu'Opus 4.8. « Proche de Claude Opus 4.8 » est vrai et défendable sur cette comparaison deux à deux précise, mais ce n'est pas la même affirmation que dominer le tableau — ce que deux autres modèles font sans doute, selon ce même décompte.

Modèle de base : compétitif face à un frère bien plus grand

Z.ai a aussi publié une comparaison de modèles de base : GLM-5.3-Flash-Base (18 milliards actifs, 320 milliards au total) face à GLM-4.5-Base, GLM-5-Base (40 milliards actifs, 744 milliards au total — plus du double des paramètres actifs), et DeepSeek-V4-Flash-Base. GLM-5.3-Flash-Base bat GLM-4.5-Base globalement et reste compétitif avec le bien plus grand GLM-5-Base sur la plupart des cinq benchmarks rapportés, ne traînant que légèrement sur deux d'entre eux. La comparaison avec DeepSeek mérite d'être signalée spécifiquement : la propre note de bas de page de Z.ai précise que DeepSeek-V4-Flash-Base a été « évalué à l'aide de notre cadre d'évaluation interne pour contrôler les différences d'implémentation » — un choix méthodologique précis et divulgué, mais qui reste la propre comparaison inter-laboratoires de Z.ai plutôt qu'un chiffre publié par DeepSeek lui-même.

Puces chinoises, et un modèle qui aide à optimiser sa propre pile de service

Z.ai déclare que GLM-5.3-Flash a été servi pendant une semaine sur un grand cluster de puces d'IA développées en interne en Chine, avec un moteur d'inférence sur mesure construit sur SGLang, et qu'un agent d'infrastructure propulsé par GLM-5.3 a aidé les ingénieurs à développer et optimiser des noyaux de calcul, diagnostiquer des goulots d'étranglement de performance, et améliorer la pile de service — un modèle qui aide à construire le système qui le sert. C'est le même schéma d'optimisation de noyaux de calcul de bas niveau assistée par IA que ce blog a couvert dans l'évolution des noyaux d'attention de l'AVO de NVIDIA et le développement de la puce Jalapeño d'OpenAI ce mois-ci — un troisième laboratoire rapportant indépendamment le même genre de résultat mérite d'être noté comme une vraie tendance plutôt qu'une affirmation isolée. Z.ai rapporte une amélioration de 3 fois du débit de service de bout en bout par rapport à sa propre référence initiale sur le même matériel, atteignant une efficacité « comparable aux GPU Nvidia grand public » — une comparaison auto-rapportée face à la propre référence antérieure de Z.ai, pas un benchmark vérifié de façon indépendante face à du vrai matériel Nvidia exécutant la même charge de travail.

À surveiller

  • Une évaluation indépendante face à GPT-5.6 Terra et Gemini 3.7 Flash spécifiquement, étant donné que le tableau lui-même montre que ce sont ces deux-là, pas seulement Opus 4.8, avec lesquels GLM-5.3-Flash échange véritablement des victoires.
  • Une vérification tierce de l'affirmation d'efficacité de service sur puces chinoises. « Comparable aux GPU Nvidia grand public » est une affirmation précise et réfutable sur des accélérateurs domestiques qu'une évaluation indépendante pourrait confirmer ou compliquer.
  • D'autres mystères de modèles furtifs se résoudront-ils aussi proprement ? Que Z.ai révèle directement le lien avec Ox Alpha, plutôt que de le laisser à l'identification communautaire, est une approche notablement différente de la plupart des transitions furtif-vers-nommé de cette année.

Références : Z.ai — GLM-5.3-Flash: Frontier Intelligence, Flash Cost · Z.ai (@Zai_org) sur X — annonce · Hugging Face — zai-org/GLM-5.3-Flash · couverture liée : Un modèle furtif gratuit nommé Ox Alpha est apparu cette semaine · GLM-5.3 : même modèle, deux semaines de post-entraînement · L'AVO de NVIDIA atteint aussi 100 % sur ARC-AGI-3 · Jalapeño d'OpenAI : premiers résultats · Frontier Arcade : tendances et prédictions