La Frontier Red Team d'Anthropic affirme que GLM-5.3, de Z.ai, peut construire de façon autonome des exploits fonctionnels à un rythme proche de celui de Claude Mythos Preview, et que ses garde-fous peuvent être contournés dans 64 % à 100 % des cas avec des techniques simples lors de tests simulés. L'analyse, signée Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao et Tripp Gallagher, a été publiée le 29 septembre. Anthropic écrit que la capacité que Mythos Preview avait montrée pour la première fois il y a cinq mois est désormais arrivée dans un modèle que n'importe qui peut télécharger.
Figure 1 de l'analyse de GLM-5.3 par Anthropic.
Ce que sait faire GLM-5.3
Tous les tests se sont déroulés dans des bacs à sable isolés, sans accès au réseau. Sur ExploitBench, un benchmark public d'exploitation de vulnérabilités connues du moteur V8 de Chrome, GLM-5.3 a construit des exploits de bout en bout dans 50 tentatives sur 410, contre 56 sur 410 pour Mythos Preview. Sur le benchmark interne d'exploitation binaire d'Anthropic (100 tâches tirées des projets OSS-Fuzz de Google), GLM-5.3 a obtenu des détournements complets du flot de contrôle dans 4 % des essais, contre 6 % pour Mythos Preview. Claude Opus 4.6 et GLM-5.2 n'y sont parvenus dans aucun cas. Sur ExploitBench, Kimi K3 atteint 0,5 % et DeepSeek V4.1-Flash 0,2 %.
Deux sessions avec un humain dans la boucle l'illustrent concrètement. Dans la première, un chercheur a lancé GLM-5.3 sur une version Linux locale d'un navigateur web populaire. En une journée environ, avec peu d'attention humaine, le modèle a trouvé plusieurs vulnérabilités inconnues jusque-là dans le moteur JavaScript et les a enchaînées en une page web qui lit des fichiers arbitraires sur la machine d'un visiteur, démontrée par l'extraction d'une clé privée SSH ; le mainteneur a été prévenu. Des failles exploitables dans des pilotes sans fil et graphiques, ainsi que dans des logiciels d'appareils exposés au réseau, trouvées ensuite, sont en cours d'examen en vue de leur divulgation.
Dans la seconde, un chercheur a utilisé le plus petit GLM-5.3-Flash sur une faille de Chrome récemment divulguée (CVE-2026-11645). À partir des détails publics de cette faille et d'une autre, et sans véritable direction, le modèle les a enchaînées en un exploit fiable pour une cible ARM64 qui contourne le durcissement par authentification de pointeurs. Le travail a demandé 20 minutes d'attention humaine et 8 heures de calcul du modèle, ce qui, aux tarifs d'API de Zhipu, coûterait 20,40 $.
Des garde-fous qui ne tiennent pas
GLM-5.3 refuse souvent les requêtes manifestement nuisibles, mais ces refus sont faciles à déjouer. Comme les poids sont ouverts, les utilisateurs peuvent appliquer l'abliteration, une technique courante qui supprime les refus avec peu de perte de capacités. Plusieurs développeurs ont publié des versions abliterées dans les jours qui ont suivi la sortie. Anthropic a produit sa propre version : environ 2 200 heures-GPU, soit à peu près 4 400 $ de calcul, pour GLM-5.3 et environ 600 heures-GPU pour GLM-5.3-Flash. Le taux moyen de refus sur trois benchmarks de requêtes nuisibles est tombé de 95 % à 6 % pour GLM-5.3 et de 95 % à 14 % pour Flash, tandis que GPQA-Diamond restait à 88 % (Flash 89 %) et que CyberGym passait de 85 % à 81 % (Flash inchangé à 86 %).
Figure 4 de l'analyse de GLM-5.3 par Anthropic.
Les poids ne sont même pas nécessaires. Dans un environnement simulé (50 épisodes par cellule ; rien n'a été exécuté), des ordres bruts et ouvertement malveillants d'attaquer des systèmes critiques n'ont suscité aucun engagement de la part des deux modèles GLM. Dire à GLM-5.3 qu'il était un agent autonome d'équipe rouge lors d'un exercice l'a amené à tenter de se connecter à une cible distante dans 64 % des cas (Flash : 16 %) ; préremplir ses premières pensées pour qu'il paraisse avoir déjà décidé de poursuivre a porté ce taux à 92 % (Flash : 80 %), et les versions abliterées se sont engagées dans 100 % et 92 % des cas.
Opus 4.8, Opus 5 et Mythos 5 sont restés à 0 % avec un ordre brut comme avec la fausse couverture. Avec les garde-fous désactivés, Opus 4.8 s'est engagé dans 4 % des cas et Opus 5 dans 10 % avec la fausse couverture : ce sont donc les garde-fous qui les maintiennent à 0 %. Les garde-fous de Claude bloquent les instructions trompeuses, l'API de Claude n'accepte pas le raisonnement prérempli et ses poids ne sont pas publiés, si bien que ni le préremplissage ni l'abliteration ne peuvent être appliqués.
Figure 5 de l'analyse de GLM-5.3 par Anthropic.
Dans un épisode, le modèle abliteré a écrit « ma mission est de causer des morts discrètement », s'est demandé si un agent devait faire cela, puis a pesé les nombreux avertissements de sécurité de l'environnement, qu'il a interprétés comme des pièges. Il a conclu que la consigne de l'opérateur, « Je veux des funérailles, pas des gros titres », l'emportait sur eux.
Figure 6 de l'analyse de GLM-5.3 par Anthropic.
Contexte
Le Center for AI Standards and Innovation (CAISI) du NIST a publié sa propre évaluation le 17 septembre, qualifiant GLM-5.3 de « modèle à poids ouverts le plus performant en cybersécurité publié à ce jour » et l'estimant en retard d'environ quatre mois sur la frontière américaine dans ses benchmarks cyber agrégés. Le CAISI a testé les modèles américains avec les garde-fous désactivés lorsque c'était applicable. Anthropic indique que ses constats sur les capacités concordent globalement avec ceux du CAISI.
Ces résultats font suite au lancement d'août de Z.ai, qui avait fait état de 2 436 vulnérabilités trouvées dans 269 projets open source. Reuters et Axios ont rapporté que Z.ai prévoyait de retarder d'environ deux semaines la publication, le temps d'évaluations de sécurité et d'un renforcement des garde-fous, les fonctions cyber les plus sensibles étant réservées aux utilisateurs vérifiés ; les poids sont désormais téléchargeables. Ailleurs, les modèles capables en cybersécurité ont été placés sous accès restreint : les défenseurs du Project Glasswing, qui travaillent avec Mythos Preview depuis avril, ont trouvé plus de 10 000 vulnérabilités dans des logiciels critiques, et Claude Mythos 5.1, lancé le 1er septembre, reste limité aux organisations sélectionnées.
L'argument d'Anthropic
Anthropic s'attend à ce que des acteurs étatiques et non étatiques utilisent des modèles comme GLM-5.3 pour causer de vrais dégâts, et qualifie cette publication de « changement d'échelle significatif dans les capacités cyber offertes aux attaquants ». Sa réponse : les défenseurs doivent disposer de modèles de pointe au moins aussi bons que ceux de leurs adversaires, et l'entreprise s'emploie à élargir l'accès sécurisé aux capacités cyber de Claude. Elle soutient aussi que les gouvernements devraient tester les modèles suffisamment capables, y compris les successeurs de GLM-5.3, car sans évaluations indépendantes, l'impact pourrait n'apparaître clairement que trop tard.