2026-08-05

La longueur de contexte est figée à 1M depuis 30 mois

AIBenchmarksArchitecture🌍 North America

Voici un chiffre tiré du jeu de données de l'arcade qui m'a surpris en allant le chercher.

Gemini 1.5 a introduit une fenêtre de contexte d'un million de tokens en février 2024. Aujourd'hui, onze modèles du jeu de données annoncent un contexte de 1M : Claude Opus 5, Inkling, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, GLM-5.2, DeepSeek v4 et V4-Flash, MiniMax-M3, Laguna S 2.1, et d'autres. Tous les grands laboratoires, trois générations de modèles, trente mois.

Pas un seul ne l'a jamais dépassé. Pas même de peu. Le contexte maximal dans un jeu de 241 sorties est resté exactement à 1,0M depuis début 2024, tandis que le nombre de paramètres passait de 176 Md à 2,8 T et que les prix chutaient de deux ordres de grandeur. Tout le reste dans cette industrie a bougé. Ce chiffre-là est resté immobile.

Alors quand Pokee-Isaac 28B est sorti aujourd'hui en revendiquant 10 millions de tokens, la question intéressante n'est pas de savoir si c'est impressionnant. C'est de savoir si le mur a jamais été technique.

Pourquoi 1M a tenu

Le plateau n'est ni une coïncidence ni un complot — c'est l'endroit où l'arithmétique cesse de fonctionner.

Un transformer décodeur classique exécute une attention softmax à chaque couche, et chaque couche conserve un cache KV proportionnel à la longueur de séquence. Doublez le contexte, doublez le cache, à chaque couche, pour chaque requête simultanée. Quelque part au-delà du million de tokens, la mémoire nécessaire à une seule conversation dépasse ce que l'on peut lui consacrer de façon rentable, et l'économie du service s'effondre avant l'architecture. 1M correspond en gros à l'endroit où « nous pourrions » et « nous pouvons nous le permettre » divergent.

C'est pourquoi le cadrage le plus utile est celui-ci : les laboratoires qui annonçaient 1M ne butaient pas sur un plafond de capacité. Ils butaient sur un plafond de coût de service — et, comme le billet sur LFM2.5 le notait hier, la façon de franchir un plafond de cache KV n'est pas de grossir, c'est de cesser de payer un cache KV par couche.

Pokee décrit l'architecture d'Isaac comme propriétaire et non exclusivement décodeur — et c'est là, malheureusement, toute la divulgation. Le rapport technique ne précise ni l'architecture, ni le mécanisme d'attention, ni le schéma de gestion mémoire. Un rapport technique qui tait le mécanisme est un document marketing avec des références, et cela compte ici plus qu'ailleurs, car l'affirmation des 10M repose entièrement sur la partie non divulguée. Tout le reste — le prix, le déploiement sur un seul GPU, le score RULER — découle de ce qu'ils ne disent pas.

Pour ce que cela vaut, « non exclusivement décodeur », associé à un contexte de 10M et à un déploiement sur un seul GPU, pointe fortement dans la même direction que la conception hybride à convolutions de LFM2 : la plupart des couches maintenant un état de taille fixe plutôt qu'un cache qui grandit avec l'entrée. C'est une déduction de ma part, pas une confirmation de Pokee. Deux sorties en deux jours, toutes deux affirmant que l'enveloppe de déploiement est fixée par l'architecture et non par le nombre de paramètres.

La provenance dont personne n'a fait son titre

Un détail mérite plus d'attention qu'il n'en a reçu : une partie d'Isaac est affinée à partir de Qwen3.6-27B, sous Apache 2.0, le reste des poids étant entraîné depuis zéro par Pokee. L'entreprise prend soin de préciser qu'il ne s'agit pas d'un fine-tune Qwen classique, ce qui est juste — on ne passe pas d'un modèle décodeur à 1M de contexte à un modèle non-décodeur à 10M par simple fine-tuning.

Mais cela s'inscrit exactement dans un schéma que ce blog a rencontré deux fois en trois jours. Namazu, de Sakana, a bâti l'offre d'IA souveraine du Japon sur DeepSeek et Kimi K2.6. Pokee, une startup américaine, a bâti sa revendication de pointe en partie sur les poids d'Alibaba. Les modèles ouverts chinois ne se contentent plus de concurrencer sur les prix — ils deviennent le substrat sur lequel d'autres entreprises construisent leurs produits, à Tokyo comme à San Francisco. C'est une forme d'influence qu'aucune activité d'API ne peut acheter, et elle ne coûte rien à Alibaba par requête Pokee.

Cela pose aussi un plancher utile sous le scepticisme. Quel que soit le mécanisme des 10M d'Isaac, il est bâti sur une base dont les capacités sont connues et documentées de façon indépendante — ce qui offre plus d'assise qu'une revendication partie de zéro par une startup.

Les affirmations, et celle qui compte

Pokee-Isaac 28B
Contexte10M tokens
RULER à 10M93,3%
RULER, 256K–4M~95
Prix0,15 $ en entrée / 1,00 $ en sortie par M de tokens
Matérielun seul GPU, à partir d'une RTX 4090
Prefilljusqu'à 137K tok/s sur un B200 à 10M de contexte
Agentiqueen tête sur BFCL v4 et τ³-bench dans l'évaluation de Pokee

Le chiffre qui compte est RULER, et le fait de l'avoir choisi est l'élément le plus crédible de ce lancement.

La longueur de contexte annoncée est la statistique la plus gonflée de l'IA. Un modèle peut accepter un million de tokens et cesser d'utiliser réellement quoi que ce soit au-delà de 128K — et les tests de type aiguille dans une botte de foin, ceux que les laboratoires publient d'habitude, sont faciles à réussir tout en se dégradant fortement dès qu'un raisonnement multi-sauts sur la fenêtre est nécessaire. RULER existe précisément pour mesurer le contexte effectif face au contexte nominal. C'est le benchmark le plus susceptible d'embarrasser celui qui l'exécute.

Pokee l'a exécuté à pleine capacité de 10M et publie 93,3%, en affirmant que les concurrents échouent au-delà de 2M. Choisir le test conçu pour vous prendre en défaut constitue un indice faible de bonne foi — pas une preuve, mais l'inverse de ce que ferait une entreprise gonflant un chiffre de contexte.

Le prix est la seconde histoire

0,15 $ en entrée / 1,00 $ en sortie par million de tokens passe sous tout ce que contient le tableau de tarification établi par ce blog la semaine dernière — y compris GPT-5.6 Luna à 0,20 $/1,20 $, qui venait d'être réduit de 80% et constituait l'offre la moins chère d'un laboratoire de pointe. Claude Fable 5 est à 10 $/50 $.

Un modèle de 28 Md tarifé en dessous de ce qu'OpenAI vend de moins cher, revendiquant dix fois le contexte de tout ce que livrent Anthropic ou Google, déployable sur un GPU de jeu. Si ne serait-ce que la moitié de cela survit à des tests indépendants, c'est une version plus tranchante de l'argument de banalisation que n'en a produit aucune sortie chinoise à poids ouverts — car celle-ci ne casse pas les prix malgré un écart de capacité. Elle revendique une avance de capacité.

Où placer le scepticisme

Tous les chiffres ci-dessus sont ceux de Pokee, issus de sa propre évaluation — la réserve habituelle que ce blog applique à Alibaba, SK Telecom, Mistral et à tous les autres. Deux points méritent d'être signalés :

« Classe frontière » fait un travail énorme pour un modèle de 28 Md. Les avances agentiques sur BFCL v4 et τ³-bench sont explicitement « dans l'évaluation de Pokee ». Rien ici n'a été reproduit par Artificial Analysis, LMArena, ou un quelconque tiers.

C'est fermé — de la part d'une entreprise dont le modèle précédent ne l'était pas. Pokee a ouvert PokeeResearch-7B en octobre 2025, poids sur Hugging Face et code sur GitHub. Isaac est en code fermé, présenté comme tel « pour l'instant ». C'est un revirement dans le sens inverse de celui que suivent la plupart des laboratoires, et cela signifie que l'affirmation des 10M peut être testée via l'API mais pas auditée dans les poids.

Ce qui rend cela plus vérifiable que l'avant-première sans benchmarks de Qwen3.8-Max, en revanche, c'est qu'Isaac est en ligne, à des prix publiés, sur un point de terminaison compatible OpenAI. N'importe qui disposant de 20 $ et d'un long document peut commencer à falsifier l'affirmation RULER dès cette semaine. Une affirmation audacieuse que l'on peut tester immédiatement est un artefact catégoriquement meilleur qu'une affirmation audacieuse que l'on ne peut pas tester.

À surveiller ensuite

  • Des exécutions RULER indépendantes à 10M constituent toute l'histoire. Ni BFCL, ni τ³-bench, ni le prix. Si un tiers reproduit 93,3% à pleine capacité, c'est le résultat architectural le plus important de l'été ; si le contexte effectif s'effondre à 2M, c'en est le chiffre marketing le plus coûteux.
  • Attendez-vous à ce que le plateau de 1M cède de façon générale, pas seulement ici. Un mur qui a tenu trente mois a tenu pour des raisons économiques, et dès qu'un fournisseur démontre une structure de coût de service qui le franchit, « 1M » cesse de se lire comme une spécification pour se lire comme une limitation.
  • Surveillez si Isaac s'ouvre. Pokee a déjà publié en open source. Un modèle de 28 Md à cette capacité revendiquée, publié ouvertement, atterrirait directement dans le palier local de l'haltère — et un modèle à 10M de contexte qui tourne sur une 4090 est une proposition véritablement différente d'un modèle de 2,8 T qui exige dix-huit H100.

Références : Pokee Console — Pokee-Isaac 28B · Pokee AI · PokeeAI/pokee_research_7b sur Hugging Face · Pokee-AI/PokeeResearchOSS sur GitHub · MarkTechPost — PokeeResearch-7B · couverture liée : LFM2.5-2.6B · La guerre des prix que personne ne mène vraiment · Open Weights You Can't Actually Run · le jeu de données de l'arcade