La semaine dernière, ce blog soutenait que « poids ouverts » s'était scindé en deux choses partageant un mot : les modèles que n'importe qui peut faire tourner, et ceux que personne ne peut — Kimi K3 étant librement téléchargeable et nécessitant environ dix-huit H100 pour tenir en mémoire. Une ouverture bornée par la physique plutôt que par le droit.
Cursor vient de livrer la même forme un cran plus bas dans la pile. Mixture-of-Kittens (MoK) est le megakernel d'entraînement mixture-of-experts derrière Composer, leur modèle de codage agentique, publié sous Apache 2.0 — l'échelon le plus permissif de l'échelle d'ouverture, sans seuil de chiffre d'affaires, sans politique d'usage acceptable, sans vérification préalable. Il exige aussi du silicium NVIDIA Blackwell SM100 ou SM103, ce qui signifie en pratique un rack GB200 ou GB300 NVL72.
Soixante-douze GPU Blackwell, dans un seul rack, comme ticket d'entrée. La licence n'exclut personne ; le matériel exclut presque tout le monde.
Ce qu'il fait réellement
Le problème que résout MoK est précis et, si vous entraînez des modèles MoE, douloureusement familier : la couche mixture-of-experts était devenue le goulot d'étranglement de la montée en charge de l'entraînement de Composer, consommant plus de la moitié du temps d'entraînement de bout en bout selon la charge de travail et la configuration. Ni l'attention, ni l'optimiseur — le routage des experts et la communication all-to-all qu'il implique.
La réponse de MoK consiste à cesser de traiter communication et calcul comme des étapes distinctes. Il fusionne toute la communication et tout le calcul MoE en un seul noyau, recouvrant calcul et réseau inter-GPU à une granularité configurable, et éliminant entièrement la synchronisation CPU–GPU. Un noyau, un lancement, aucun aller-retour vers l'hôte au milieu de la couche.
Face aux meilleures références publiques, Cursor rapporte :
| Passe | Précision | Accélération |
|---|---|---|
| Avant | MXFP8 | 2,37× |
| Arrière | MXFP8 | 1,78× |
| Avant | BF16 | 1,92× |
| Arrière | BF16 | 1,58× |
De bout en bout, ils l'évaluent à 1,41× de débit par rapport à leur propre pile précédente — le chiffre le plus honnête, puisque les microbenchmarks de noyaux flattent toujours et que la pile précédente était elle-même déjà optimisée (Cursor avait publié auparavant des noyaux MXFP8 sur mesure valant 1,5×). Il est en production, alimentant l'entraînement de Composer sur des dizaines de milliers de GPU, signé Stuart Sul, Nash Brown, Henry Wildermuth, William Lin et Federico Cassano.
Le nom est un clin d'œil à la lignée « kittens » du travail sur les noyaux GPU ; le dépôt ne revendique aucune dépendance technique, il faut donc y lire un hommage plutôt qu'une architecture.
Le déterminisme est la partie sous-estimée
Enfoui dans la description, un mot travaille davantage que les accélérations : entièrement déterministe.
Le déterminisme coûte habituellement de la performance. La façon rapide de réduire entre GPU consiste à laisser les résultats arriver dans l'ordre qu'ils veulent, et l'addition en virgule flottante n'est pas associative : la même exécution deux fois donne donc des nombres légèrement différents. La plupart des piles d'entraînement l'acceptent. La revendication de Cursor est le déterminisme et 2,37× — c'est cette combinaison qui est réellement difficile, pas l'un ou l'autre isolément.
Pourquoi cela compte au-delà du débogage : une campagne d'entraînement que l'on ne peut pas reproduire est une campagne que personne ne peut auditer. Ce blog a passé la semaine écoulée sur la vérifiabilité — Chain-of-Evidence obligeant chaque affirmation d'un article généré à remonter à une source, les certificats Lean rendant une preuve vérifiable par machine, des harnais d'évaluation qui se sont révélés ne pas contenir ce qu'ils annonçaient. Les noyaux déterministes relèvent du même instinct appliqué à l'entraînement lui-même : ils ne rendent pas un résultat correct, mais ils font de « nous avons lancé ceci et obtenu cela » une affirmation réfutable plutôt qu'une anecdote.
Pour être précis sur la portée, car il est facile de surestimer : le déterminisme signifie ici mêmes entrées, même matériel, même résultat d'une exécution à l'autre. Cela ne signifie pas que quelqu'un d'autre peut reproduire l'entraînement de Cursor — il faudrait encore leurs données, leur configuration et le rack. C'est une condition nécessaire à la reproductibilité, pas une condition suffisante.
Ce que Cursor protège réellement
La lecture stratégique est la plus intéressante, car Cursor occupe une position étrange dans la pile.
Ce blog soutenait il y a une semaine que le harnais de codage est la couche délibérément conçue pour un coût de changement nul — Cursor en étant l'exemple canonique, ayant fait du choix du modèle un simple menu déroulant plutôt qu'une identité. Si tout l'argumentaire de votre produit est que le modèle en dessous est interchangeable, vous avez bâti une entreprise sur une couche banalisée.
La réponse de Cursor a été de descendre dans la pile : entraîner Composer, posséder un modèle. Et maintenant de donner l'infrastructure située sous ce modèle, gratuitement et sans conditions. Ce qui indique exactement ce qu'ils estiment ne pas être leur barrière à l'entrée. Pas les noyaux — ce sont un atout de recrutement et de crédibilité, et les ouvrir ne coûte rien stratégiquement, puisque les seules personnes capables de les utiliser disposent déjà de leurs propres équipes noyau. Pas non plus, à l'évidence, le modèle, vu la vitesse à laquelle ce palier se banalise.
C'est le même calcul que Mistral avec Shieldstral et Liquid avec LFM2.5 : donner la couche qui n'est pas défendable, à la permissivité maximale que cette couche peut supporter, et garder le produit. Le schéma commun aux trois est que les publications open source de 2026 ciblent de plus en plus précisément ce qui n'est pas la barrière à l'entrée.
Ce qui se généralise
Placez MoK à côté des modèles catalogués par ce blog et un énoncé plus net du problème de l'ouverture apparaît. Il existe désormais au moins trois verrous indépendants sur toute publication « ouverte » :
- Juridique — ce que la licence permet. Apache 2.0 ici ; plafond de 10 M$ de chiffre d'affaires pour LFM2.5 ; recherche uniquement pour Instella-MoE d'AMD.
- Physique — le matériel exigé. Un ordinateur portable pour LFM2.5 ; dix-huit H100 pour Kimi K3 ; un rack NVL72 pour MoK.
- Pratique — la compétence environnante nécessaire pour s'en servir. Les noyaux en sont le cas extrême : même avec le rack, ce n'est pas un composant qu'on branche.
MoK est maximalement ouvert sur le premier verrou et presque maximalement fermé sur les deux autres. Kimi K3 en est quasiment au même point. Pendant ce temps, LFM2.5-2.6B est restreint sur le premier verrou et grand ouvert sur les deux autres — et constitue, pour presque tous les lecteurs, la publication la plus utilisable.
Ce qui suggère de lire l'échelle en deux dimensions plutôt qu'une. « À quel point est-ce ouvert ? » continue de recevoir une réponse en termes de licence, alors que la licence est fréquemment la contrainte la moins déterminante de la pile.
À surveiller ensuite
- Attendez-vous à davantage de publications de noyaux par les laboratoires de pointe, et attendez-vous à ce qu'elles soient toutes en Apache 2.0. Les noyaux sont ce qu'un laboratoire peut ouvrir le plus sereinement : crédibilité énorme, coût concurrentiel quasi nul, et un public déjà filtré par les dépenses d'investissement.
- Le déterminisme devient un argument de vente plutôt qu'une note de bas de page. Dès lors qu'une pile de production démontre qu'il n'y a pas à l'échanger contre de la vitesse, « notre entraînement est reproductible » cesse d'être une absence en forme d'excuse.
- L'exigence NVL72 date cette publication très vite. Un noyau écrit depuis les premiers principes pour une génération de rack est un pari sur la durée de cette génération. La question intéressante est de savoir si MoK sera porté vers ce qui succédera à Blackwell, ou s'il deviendra un artefact magnifiquement conçu d'un instant matériel.
Références : Cursor — annonce de Mixture-of-Kittens · cursor/mixture-of-kittens sur GitHub (Apache 2.0) · Cursor — entraînement MoE 1,5× plus rapide avec des noyaux MXFP8 sur mesure · Couverture MarkTechPost · couverture liée : Open Weights You Can't Actually Run · How Open Is "Open"? · La guerre des prix que personne ne mène vraiment · LFM2.5-2.6B