Les poids de Kimi K3 sont gratuits. La licence est proche de MIT. N'importe qui peut télécharger 2 800 milliards de paramètres dès maintenant.
Presque personne ne peut les faire tourner.
À la précision native du modèle, MXFP4 — déjà du 4 bits, donc c'est un plancher et non une estimation de compression — les poids occupent à eux seuls environ 1,4 téraoctet de mémoire. C'est à peu près dix-huit H100, ou trois nœuds DGX complets, avant même d'allouer un seul jeton du contexte d'un million de jetons annoncé. Sur du matériel grand public, cela représente environ quarante-quatre RTX 5090. Le modèle de pointe le plus ouvert jamais publié est, pour un individu, fonctionnellement inaccessible.
Il vaut la peine de se demander si c'est la direction générale que prennent les poids ouverts. J'ai repris quatre ans de données de sortie dans l'arcade pour vérifier.
Ce que montrent réellement les données
En prenant chaque sortie à poids ouverts avec un nombre de paramètres divulgué :
| Année | Sorties | Taille médiane | Plus grand | ≥200 Md | ≤32 Md |
|---|---|---|---|---|---|
| 2022 | 4 | 152,5 Md | 176 Md | 0 | 1 |
| 2023 | 12 | 43,4 Md | 180 Md | 0 | 4 |
| 2024 | 27 | 70,0 Md | 671 Md | 5 | 11 |
| 2025 | 22 | 120,0 Md | 1 000 Md | 10 | 10 |
| 2026 | 33 | 118,0 Md | 2 800 Md | 13 | 13 |
L'intuition a à moitié raison, et la moitié qui se trompe est la partie intéressante.
Le plafond a explosé. De 176 Md en 2022 à 2 800 Md en 2026 — une hausse de 16×, dont la majeure partie sur les dix-huit derniers mois. Kimi K2 a franchi la barre des mille milliards en juillet 2025 ; DeepSeek v4 et LongCat-2.0 ont atteint 1 600 Md ; K3 a presque redoublé la mise.
La médiane n'a pas bougé. 120 Md en 2025, 118 Md en 2026. Stable.
Et le petit bout a grandi en valeur absolue. Treize sorties ouvertes à 32 Md ou moins en 2026, contre dix en 2025 et onze en 2024. Personne n'a arrêté de publier des petits modèles.
Ce n'est donc pas une dérive vers le haut. C'est un haltère. La distribution s'écarte aux deux extrémités pendant que le milieu reste immobile, et dire que « les modèles ouverts deviennent trop gros » fait s'effondrer deux phénomènes distincts qui se produisent pourtant simultanément.
Deux catégories qui partagent un mot
Regardez ce qui se trouve à chaque extrémité, et la scission cesse de paraître accidentelle.
| Modèle | Taille | Poids en 4 bits | Fonctionne sur |
|---|---|---|---|
| Kimi K3 | 2 800 Md | ~1 400 Go | ~18× H100 |
| DeepSeek v4 | 1 600 Md | ~800 Go | ~10× H100 |
| Kimi K2.7-Code | 1 000 Md | ~500 Go | ~7× H100 |
| GLM-5.2 | 753 Md | ~377 Go | ~5× H100 |
| DiffusionGemma | 26 Md (4 Md actifs) | ~13 Go | un seul GPU grand public |
| Antares-1B | 1 Md | ~0,5 Go | un ordinateur portable |
Ce ne sont pas des points concurrents sur une même courbe. Ce sont des réponses à des questions différentes.
Les géants sont des artefacts de souveraineté. Leur public, ce sont les gouvernements, les laboratoires nationaux, les fournisseurs de cloud et les entreprises bien financées — des organisations qui ont besoin d'un modèle de pointe qu'elles contrôlent plutôt que louent, et qui possèdent déjà ou peuvent louer le matériel. Que K3 soit téléchargeable compte énormément pour une banque européenne ou un cloud chinois, et pas du tout pour un développeur avec une 4090. Le fait que les poids soient publics accomplit tout de même quelque chose de réel : c'est la différence entre une capacité qu'on peut auditer, affiner et déployer sur son propre matériel, et une capacité qui vit derrière l'API et les conditions d'utilisation de quelqu'un d'autre.
Les petits modèles sont des artefacts de déploiement, et ils sont de plus en plus conçus pour une tâche précise plutôt que pour une capacité générale. Antares de Cisco fait de la localisation de vulnérabilités à 1 Md et bat GLM-5.2 (753 Md) sur cette seule tâche. DiffusionGemma sacrifie la précision de raisonnement pour la latence locale. NVIDIA propose Nemotron en 3 Md/8 Md/14 Md. Ce sont les modèles que le développeur individuel fait réellement tourner, et ils sont devenus meilleurs, pas plus rares.
Le mot « ouvert » travaille trop
Le vrai problème n'est pas que les grands modèles ouverts existent. C'est qu'un seul mot couvre désormais deux réalités qui n'ont presque rien en commun, et l'ambiguïté est exploitée dans les deux sens.
Quand un laboratoire dit « nous avons publié un modèle de pointe ouvert », l'affirmation implicite est celle de la démocratisation — n'importe qui peut y avoir accès. Quand l'exigence pratique est dix-huit H100, la version honnête serait « nous l'avons publié pour les deux cents organisations capables de se permettre de le faire tourner ». C'est encore significatif. Simplement, ce n'est pas ce que la plupart des gens entendent.
Le débat politique hérite de la confusion en bloc. Le débat sur la restriction des poids ouverts chinois traite les « poids ouverts » comme une catégorie unique, mais le profil de risque de prolifération d'un modèle de sécurité de 1 Md qu'on fait tourner sur un ordinateur portable et celui d'un modèle de pointe de 2 800 Md nécessitant un centre de données ne sont absolument pas comparables. Cisco a pu publier Antares ouvertement parce que c'est petit et étroit. L'ouverture de K3 est bornée par la physique, quelle que soit la décision d'un régulateur — et simultanément, des poids une fois téléchargés ne peuvent véritablement pas être rappelés, ce qui explique pourquoi l'argument d'application de la loi tourne en rond.
Là où ça mord réellement
Deux conséquences en découlent, et aucune n'est celle vers laquelle on se tourne habituellement.
L'ouverture à la pointe devient une question de licence, pas d'accès. La licence de K3 est l'artefact intéressant, pas le lien de téléchargement — de type MIT, avec une exception uniquement pour les opérateurs de Model-as-a-Service au-dessus de 20 millions de dollars de revenus. Cette clause indique exactement à qui Moonshot s'attend à voir faire tourner ce modèle : pas des individus, mais des entreprises assez grandes pour le revendre. La licence est écrite pour le public que l'exigence matérielle a déjà sélectionné.
L'écart qui compte concerne les fournisseurs de services, pas les individus. Le développeur individuel n'allait jamais faire tourner un modèle de pointe en local, et le niveau des petits modèles le sert de mieux en mieux chaque trimestre. Ce que les poids ouverts de pointe changent, c'est le milieu — le cloud régional, le laboratoire national, l'entreprise avec une exigence de conformité. Avant, leur seule option de pointe était une API américaine. Maintenant, il existe une alternative qui fonctionne sur du matériel qu'ils contrôlent. C'est un véritable changement de structure de marché, et cela n'a rien à voir avec la possibilité de faire tourner K3 sur un ordinateur de bureau.
Donc : oui, les sorties ouvertes au sommet deviennent énormes, et non, cela n'évince pas les modèles que les gens normaux utilisent. Ce que cela signifie, c'est que « poids ouverts » a cessé d'être une seule chose, et plus vite le vocabulaire rattrapera cette réalité — niveau souveraineté contre niveau local —, moins le marketing et la réglementation seront confus.
La mise en garde honnête sur tout ceci : les données de taille ne couvrent que les modèles ayant divulgué un nombre de paramètres, ce qui concerne très majoritairement les modèles ouverts. Les laboratoires fermés ont cessé de publier les tailles il y a des années. L'haltère est réel, mais c'est un haltère dont nous ne voyons clairement qu'une extrémité.
Mise à jour — 29 juillet : le gradient des licences ne suit pas l'échelle
Deux jours après la publication de cet article, trois sorties survenues la même semaine ont rendu l'un des arguments ci-dessus trop simpliste, il vaut donc mieux le corriger que le laisser tel quel.
J'ai affirmé que l'ouverture à la pointe « devient une question de licence, pas d'accès », et j'ai utilisé l'exception de revenus Model-as-a-Service de Kimi K3 comme preuve que les licences des grands modèles sélectionnent discrètement les quelques organisations capables de les faire tourner. La première moitié tient. L'implication selon laquelle les licences se durcissent à mesure que les modèles grossissent ne tient pas.
| Sortie | Taille | Licence |
|---|---|---|
| Kimi K3 (Moonshot, 26 juil.) | 2 800 Md | Quasi-MIT, exception au-dessus de 20 M$ de revenus MaaS |
| Instella-MoE (AMD, 26 juil.) | 16 Md | ResearchRAIL — recherche uniquement, pas d'usage commercial |
| A.X K2 (SK Telecom, 29 juil.) | 688 Md | Apache-2.0, recherche et commercial, sans conditions |
Le modèle de 688 Md est plus librement licencié que celui de 16 Md. La sortie d'AMD — la plus complète en termes d'artefacts, avec tous les points de contrôle intermédiaires et ses mélanges de données — porte l'octroi le plus restrictif sur les poids eux-mêmes. Et la licence la plus libre à l'échelle de pointe vient d'un programme de souveraineté soutenu par un État, et non d'un laboratoire commercial.
Il y a donc ici deux axes indépendants, et je les ai confondus. L'échelle détermine qui peut physiquement faire tourner un modèle. La licence détermine qui est autorisé à le faire. Ils ne sont pas corrélés, car ils répondent à des pressions différentes : les exigences matérielles découlent de l'architecture, tandis que les licences découlent de ce que l'organisation qui publie souhaite provoquer ensuite. Moonshot veut des revenus de revendeurs. AMD veut des citations de recherche et une visibilité ROCm sans financer les produits de ses concurrents. Le programme Dopamo de Corée veut une adoption industrielle nationale, et l'adoption est maximisée en ne demandant rien.
Le constat de l'haltère survit intact — il portait sur la taille, et les données de taille n'ont pas changé. Mais « l'ouverture » doit être lue comme deux questions distinctes, et un seul mot couvrant les deux est exactement l'ambiguïté que cet article se proposait de dénoncer. Je l'ai reproduite en la diagnostiquant.
Liens
- Données : l'Arcade Frontier — toutes les sorties ci-dessus, avec les tailles
- Contexte : La semaine où Washington a flirté avec l'interdiction des poids ouverts
- Le modèle qui a suscité cet article : Kimi K3
- L'autre extrémité de l'haltère : DiffusionGemma