Un nouveau modèle se présentant comme Ox Alpha est apparu sur OpenRouter et, selon l'annonce même d'OpenCode (relayée via une capture d'écran du message d'OpenCode plutôt qu'un lien que cet environnement pouvait récupérer directement), comme option gratuite pendant une semaine sur le plan OpenCode Zen à partir du 20 août — une fenêtre de contexte d'1 million de tokens, une entrée multimodale (la propre fiche d'OpenRouter indique texte, image et vidéo), et, selon les conditions énoncées par OpenCode, une absence de rétention des données sur les invites et les complétions. Ce genre de sortie furtive n'est pas nouveau : un laboratoire publie un modèle de façon anonyme sur un fournisseur comme OpenRouter pour recueillir un signal réel avant un lancement nommé, et selon la plupart des décomptes communautaires, il s'agit à peu près de la cinquième sortie anonyme de ce genre en six mois, les quatre précédentes ayant été finalement retracées à des laboratoires chinois — GLM-5 de Zhipu, MiMo-V2-Pro de Xiaomi, Ling-2.6-flash d'Ant Group, et LongCat-2.0 de Meituan. Ce qui mérite d'être couvert cette fois n'est pas tant le mystère lui-même que la façon dont il a été résolu, et à quelle vitesse.
La question d'identité, et deux façons dont on a réellement tenté d'y répondre
Deviner le laboratoire derrière un modèle furtif relève d'habitude du ressenti — style d'écriture, motifs de refus, la façon dont il traite un type de blague précis. Cette fois, deux personnes ont mené une véritable identification technique plutôt qu'une intuition, avec des méthodes sans rapport, et sont arrivées à la même réponse.
La première : un compte se présentant comme Pliny the Liberator a rapporté les résultats d'un agent automatisé qui a comparé les comptages de tokens d'invite renvoyés par l'API d'Ox Alpha à ceux de plusieurs modèles candidats, sur 15 chaînes de test — ASCII, code Python, texte CJK, emoji, arabe, hébreu, thaï, Unicode rare, espaces blancs, regex, HTML, JSON, et une longue chaîne répétée. Les comptages de tokens d'Ox Alpha correspondaient exactement à ceux de GLM-5.3 de Zhipu sur les 15 tests (erreur absolue moyenne de 0,0), avec un décalage constant de 75 tokens sur chaque chaîne — cohérent avec un gabarit de conversation fixe ajouté par-dessus un tokenizer sous-jacent identique, et non un vocabulaire différent. Le même test contre MiMo-V2.5-Pro de Xiaomi — un candidat plausible étant donné que le propre MiMo-V2-Pro de Xiaomi faisait partie des quatre sorties anonymes chinoises précédentes — a donné une erreur absolue moyenne de 65,8 et seulement 2 correspondances exactes sur 15 — un raté net, pas un cas limite.
La seconde méthode, indépendante : un compte se présentant comme chetaslua a rapporté avoir envoyé une requête délibérément malformée qui a fait renvoyer par le serveur une trace de pile brute, nommant une classe interne — com.wd.paas.api.domain.v4.chat.ChatCompletionRequest. Seule une partie de cette chaîne est vérifiable de façon indépendante : le segment paas/v4/chat/completions correspond à la route API documentée par Zhipu elle-même (open.bigmodel.cn/api/paas/v4), ce qui est un vrai recoupement vérifiable. Le préfixe de paquet com.wd lui-même n'est expliqué par aucune documentation publique de Zhipu — il pourrait s'agir d'un nom de code interne sans équivalent public, et devrait donc être lu comme inexpliqué plutôt que comme une confirmation indépendante en soi. Cela reste tout de même un type de preuve différent des statistiques de tokenizer : un message d'erreur qui fuit un détail d'implémentation côté serveur, plutôt qu'une inférence tirée du comportement en sortie. Deux personnes, deux techniques sans rapport, aucune coordination sous-entendue par l'un ou l'autre message, aboutissant à la même conclusion, constitue un signal nettement plus fort que l'un ou l'autre résultat pris isolément — bien que « nettement plus fort » ne signifie toujours pas « confirmé » : ni Zhipu, ni Z.ai, ni OpenRouter, ni OpenCode n'ont déclaré quoi que ce soit officiellement sur qui opère Ox Alpha à l'heure où ce billet est écrit.
Ce que cela règle, et ce que cela ne règle pas
Il vaut la peine d'être précis sur ce que chaque constat établit et n'établit pas. Zhipu a déjà un GLM-5.3 public et nommé, avec un tokenizer documenté et strictement textuel ; les deux résultats d'identification indiquent qu'Ox Alpha partage le vocabulaire sous-jacent et le routage backend de GLM-5.3, pas qu'Ox Alpha soit le checkpoint GLM-5.3 publiquement diffusé et identique — Ox Alpha accepte l'image et la vidéo en entrée, ce que la fiche publique de GLM-5.3 ne revendique pas. La lecture la plus défendable est qu'Ox Alpha est une variante de nouvelle génération ou étendue au multimodal, construite sur la même base technique, plutôt que le modèle public existant simplement rebaptisé. Cette distinction compte et se laisse facilement brouiller dans un titre.
Circule aussi à côté des hypothèses d'identité : une extraction de prompt système distincte, publiée par ce même compte Pliny the Liberator, affirmant qu'Ox Alpha avait reçu pour instruction de s'identifier uniquement comme « ox-alpha, un LLM développé par une organisation non divulguée » et jamais comme un autre modèle. La vocation déclarée de ce compte est le jailbreak et l'extraction de prompt, et le texte qu'un LLM produit quand on lui demande (ou qu'on le manipule) de révéler son propre prompt système n'est pas de façon fiable le vrai prompt système — les modèles peuvent fabriquer, et le font, des instructions plausibles sous ce genre de pression. C'est cohérent en esprit avec les preuves de tokenizer et de trace de pile — un modèle furtif avec une instruction scriptée de non-divulgation est exactement ce à quoi on s'attendrait pour un laboratoire testant anonymement — mais cela devrait être lu comme une affirmation non vérifiée et de seconde main sur la propre configuration du modèle, pas comme une preuve du même poids que les constats de tokenizer ou de trace de pile.
Les chiffres de benchmarks sont une affirmation distincte, plus faible
Des scores rapportés par la communauté ont circulé à côté de l'histoire d'identité — un chiffre autour de 87,5 % sur quelque chose appelé « Kingbench », et un rapport selon lequel Ox Alpha battrait GPT-5.6, Grok 4.6, et GLM-5.3 lui-même sur un sous-ensemble de 10 tâches DeepSWE. Ces chiffres méritent un vrai scepticisme, indépendamment de la question d'identité : la propre fiche d'OpenRouter pour ce modèle ne porterait, d'après les rapports, aucun score officiel d'intelligence, de codage ou d'agentivité, et les chiffres ci-dessus proviennent d'échantillons restreints et gérés par la communauté plutôt que d'une méthodologie divulguée et reproductible. Qu'un modèle furtif performe bien est tout à fait plausible — le GLM-5.3 confirmé de Zhipu est lui-même une sortie récente solide — mais un sous-ensemble de 10 tâches et un classement sans nom ne répondent pas au standard que ce blog applique à toute autre affirmation de benchmark, et ils n'obtiennent pas de passe-droit ici simplement parce que la preuve d'identification par empreinte se trouve être inhabituellement solide.
L'autre chiffre qui mérite d'être signalé comme une affirmation démesurée et non vérifiée : le propre message promotionnel d'OpenCode indiquerait, d'après les rapports, une capacité de 100 000 milliards de tokens par jour — de l'ordre de 1,16 milliard de tokens par seconde, en continu. C'est une affirmation d'infrastructure extraordinaire en soi, relayée ici à partir d'une capture d'écran plutôt que d'une source que cet environnement pouvait récupérer directement, et elle mérite d'être traitée avec la même prudence que tout autre chiffre de capacité auto-rapporté, en l'absence de moyen indépendant de le vérifier.
L'histoire a atteint le Twitter des marchés de prédiction
Le propre compte de Polymarket a publié un message sur Ox Alpha — « DERNIÈRE MINUTE : un mystérieux nouveau modèle d'IA "Ox Alpha" apparaît sur OpenRouter avec une fenêtre de contexte d'1 million de tokens, des capacités multimodales, et aucun propriétaire divulgué » — présenté comme une nouvelle de dernière minute, pas comme un marché lié avec des cotes chiffrées. Il vaut la peine d'être précis sur cette distinction : ce billet n'a trouvé aucun marché Polymarket réel prenant des paris sur l'origine d'Ox Alpha, seulement le compte relayant la même trame « modèle mystérieux, aucun propriétaire divulgué » que tous les autres médias ont utilisée. Ce que le message démontre réellement, c'est la portée, pas la résolution — le propre compte d'une entreprise de marchés de prédiction traitant le mystère d'une sortie furtive d'IA comme un contenu digne d'être publié pour un public général est un vrai signal de la distance parcourue par cette histoire en moins de deux jours, indépendamment du fait que quelqu'un en tarifie réellement la réponse.
Il vaut la peine de le redire clairement à mesure que l'histoire se répand vers un public plus large et moins centré sur l'IA : la preuve d'identification ci-dessus est une hypothèse principale bien étayée, pas une confirmation. « Deux empreintes indépendantes concordent » est le genre de constat facile à arrondir en « on sait » au fil des reprises — chaque reprise qui laisse tomber une réserve transforme un « signal nettement plus fort, toujours non confirmé » en « c'est GLM » quelques partages plus tard. L'étiquette correcte pour la question d'identité en ce moment est non résolue, avec une hypothèse principale bien étayée — pas résolue.
À surveiller
- Une déclaration officielle de Zhipu/Z.ai. Deux résultats d'identification indépendants et techniquement fondés pointant dans la même direction constituent une preuve circonstancielle inhabituellement forte pour un jeu de devinette de modèle furtif, mais ce n'est toujours pas une confirmation, et ce blog le traitera comme non confirmé jusqu'à ce qu'une déclaration officielle arrive.
- Une exécution de benchmark divulguée et reproductible. Si les résultats de codage d'Ox Alpha se confirment, une évaluation correctement documentée — pas un sous-ensemble communautaire de 10 tâches — est ce qui rendrait cette affirmation comparable aux scores rapportés de tout autre modèle.
- Un marché de prédiction réellement tarifé, s'il en apparaît un. Un marché en argent réel ou fictif ouvrant spécifiquement sur l'origine d'Ox Alpha constituerait un point de donnée véritablement nouveau — un type de signal différent de l'identification par empreinte sur les réseaux sociaux, agrégeant ce sur quoi un plus large ensemble de personnes est prêt à parier plutôt que ce que un ou deux enquêteurs techniques ont trouvé.
- Ce qui se passe à la fin de la fenêtre d'essai gratuit. Les conditions énoncées par OpenCode couvrent environ une semaine ; savoir si Ox Alpha se convertit en une sortie nommée et payante — et si cette sortie est attribuée à Zhipu — est la vraie résolution de cette histoire.
Références : Pliny the Liberator sur X — identification par tokenizer · Chubby (@kimmonismus) sur X — annonce d'OpenCode · chetaslua sur X — identification par trace de pile · Polymarket sur X · OpenRouter — stealth/ox-alpha · couverture liée : GLM-5.3 : même modèle, deux semaines de post-entraînement · Frontier Arcade : tendances et prédictions