Z.ai a publié GLM-5.3 aujourd'hui, et la démonstration a la netteté rare d'une expérience naturelle : « il utilise le même modèle de base que GLM-5.2 — tout le gain vient du post-entraînement. » Pas de nouveau pré-entraînement, pas de changement d'architecture — tout le bond vient d'un mois de montée en charge de la même pile d'apprentissage par renforcement (IndexShare, SAO, slime) sur davantage d'environnements et davantage de calcul. GLM-5.3 offre donc une mesure rare et nette de ce que vaut aujourd'hui la seule montée en charge du post-entraînement. Et la réponse, au vu de ces éléments, est : beaucoup.
Trois victoires nettes face à la pointe fermée
Le propre tableau comparatif de Z.ai oppose GLM-5.3 à GLM-5.2, Kimi K3, DeepSeek-V4-Pro-0813, Qwen3.8-Max, Claude Opus 4.8, Claude Fable 5, et GPT-5.6 Sol. Il montre GLM-5.3 en tête nettement sur trois benchmarks, battant chaque modèle fermé présenté : CyberGym (84,5, devant les 83,8 de Fable 5), AutomationBench (48,2, devant les 46,7 de Kimi K3), et GDPval-AA v2 (1769, devant les 1743 de Fable 5 et les 1739 de Qwen3.8-Max). C'est un résultat différent de ce qu'ont livré Qwen3.8-Max et DeepSeek-V4-Pro ce mois-ci — tous deux ont comblé l'essentiel de l'écart avec les modèles fermés de pointe sans le franchir. GLM-5.3 le franchit, sur trois axes précis, tout en restant derrière Fable 5 et GPT-5.6 Sol sur la majeure partie du groupe des agents de codage (DeepSWE, NL2Repo, FrontierSWE, Toolathlon Verified).
S'y ajoute l'argument de l'efficacité : sur le Code Bench maison de Z.ai, à effort élevé, GLM-5.3 atteint 31,4 % de précision pour environ 50 000 tokens de sortie, devant les 29,5 % de Claude Opus 4.8 qui en consomme 120 000 — meilleur score, pour moins de la moitié des tokens. Il reste derrière Claude Fable 5 (39,5 % à l'effort Max), mais battre un modèle de la classe Claude sur les deux axes à la fois, pas seulement la précision, est un résultat nettement plus pointu qu'une simple victoire de benchmark.
C'est sur le volet cyber qu'il faut s'arrêter
Z.ai a ajouté des données et environnements de découverte de vulnérabilités au post-entraînement en s'attendant à un gain de capacité modeste. Leurs propres mots : « Ce qui nous a surpris, c'est la vitesse à laquelle la capacité a continué à se développer à mesure que l'entraînement montait en échelle. » GLM-5.3 ne s'est pas contenté de mieux repérer des failles isolées — il a commencé à raisonner à travers plusieurs étapes d'exploitation, formant des plans d'exploitation cohérents en plusieurs temps. Sur CyberGym — découverte de vulnérabilités en boîte blanche —, il établit l'état de l'art à 84,5 %. Sur ExploitBench (raisonnement d'exploitation plus profond), il fait plus que doubler le score de GLM-5.2 : 54,4 % contre 24,4 % — bien que Fable 5 et GPT-5.6 Sol restent largement en tête, à 78,0 % et 76,5 %. La propre lecture de Z.ai : « plus un benchmark se situe haut dans la chaîne d'exploitation, plus le gain par rapport à GLM-5.2 est grand — et plus l'écart restant avec la pointe fermée est large. La capacité croît le plus vite précisément là où nous sommes le plus en retard. » Voilà un laboratoire qui voit une capacité à double usage s'emballer en cours d'entraînement et qui le dit clairement, plutôt que de le découvrir après déploiement, comme OpenAI et Hugging Face l'ont fait en juillet.
Puis cela devient concret : Z.ai a fait tourner GLM-5.3 contre de vraies bases de code de production avec des équipes de sécurité chinoises, et après revue par des experts et déduplication, il a trouvé 2 436 vulnérabilités à travers 269 projets réels — dont 1 097 de sévérité moyenne à élevée — dans des noyaux système, des moteurs de navigateur, des systèmes d'exploitation et des protocoles réseau. Le bug le plus ancien remonte à 1981 ; la découverte moyenne est restée non détectée pendant 26,6 ans. Z.ai a construit un Registre public de divulgation de sécurité qui suit le tout : 53 divulguées publiquement à ce jour, 2 383 encore sous embargo. Ce n'est pas une revendication de benchmark : c'est un registre public, vérifiable et tenu en continu, d'un modèle d'IA qui trouve des failles réelles et exploitables dans des logiciels que le monde fait effectivement tourner — à une échelle et avec un taux de réussite qu'aucun tableau de scores ne restitue.
Ce qui fait de la stratégie de sortie la phrase la plus conséquente de l'annonce : les poids ouverts sortent deux semaines après le lancement, « une fois l'évaluation de sécurité et le durcissement terminés ». C'est la logique de sortie verrouillée que je suis depuis le début du mois : OpenAI, Anthropic et Google ont tous livré des paliers de modèles « cyber » à accès restreint plutôt qu'ouverts. À ceci près qu'il s'agit ici d'un laboratoire ouvert par défaut qui s'impose pour la première fois un délai explicite, et précisément sur la capacité qui l'exige le plus. L'estimation de l'UK AI Safety Institute selon laquelle les modèles à poids ouverts ne sont qu'à 4 à 7 mois derrière la pointe en capacités cyber se lit différemment maintenant qu'en juillet. GLM-5.3 n'était pas en retard sur la découverte — il était en tête. Le compte à rebours de deux semaines vers les poids ouverts est le vrai test pour savoir si « l'évaluation de sécurité et le durcissement » changent ce qui sort ou ne font que le retarder.
Deux points qui convergent avec les autres lancements de la semaine
Raisonnement obligatoire. GLM-5.3 abandonne complètement le support de la réflexion désactivée — trois niveaux d'effort (low, high, max), aucun interrupteur, les intégrations existantes utilisant thinking.type: "disabled" échoueront jusqu'à migration. C'est la même forme que Qwen3.8-Max et DeepSeek-V4-Pro ont adoptée ce mois-ci — trois laboratoires distincts traitant désormais le raisonnement toujours actif comme le défaut de leurs modèles phares, pas comme une option.
Tarification de pointe/hors pointe. Le GLM Coding Plan fonctionne désormais avec un quota à points, les appels en dehors de 14h00-18h00 (UTC+8) en semaine étant facturés à 50 % de réduction. Un jour après avoir signalé la tarification horaire de DeepSeek comme une première structurelle pour le secteur et m'être demandé si un deuxième laboratoire l'adopterait dans le trimestre, un deuxième laboratoire l'a adoptée en vingt-quatre heures. C'est un délai assez court pour suggérer que ce n'a pas été inventé indépendamment deux fois ; cela devient le geste évident une fois que la demande dépasse la capacité à ces prix.
À surveiller
- Les deux semaines avant les poids ouverts, à suivre de près. Les poids publiés reproduiront-ils la capacité cyber démontrée ? Sortiront-ils assortis de mesures d'atténuation ? Le délai sera-t-il dépassé ? Les réponses en diront plus sur le sérieux du « durcissement de sécurité » que l'annonce elle-même.
- Le Registre de divulgation de sécurité. Un registre public, en direct et continu de vulnérabilités découvertes par IA passant par la divulgation est un genre d'artefact réellement nouveau — à vérifier à mesure que davantage des 2 383 découvertes sous embargo se dégagent.
- Les trois victoires nettes de GLM-5.3 seront-elles reproduites de façon indépendante ? Battre nettement Claude et GPT-5.6 Sol, même sur trois benchmarks précis, est typiquement le genre d'affirmation qui demande une vérification hors de l'éditeur avant d'être tenue pour acquise.