Après avoir ajusté des courbes sur l'ensemble du jeu de données de l'arcade, je voulais tester une hypothèse plus tranchante : que les modèles à poids ouverts passent au registre des poids lourds — l'échelle du billion de paramètres — tout en restant compétitifs face à la pointe fermée et monétisés via des API. J'ai donc retrouvé le nombre de paramètres de chaque sortie à poids ouverts du jeu de données (93 sur 102 résolues ; les tailles vivent désormais dans la base de données de l'arcade elle-même, sous les champs params_B et active_B, si bien que les analyses futures les obtiennent gratuitement).
Deux termes comptent avant les calculs. Il s'agit ici de modèles à poids ouverts — poids téléchargeables sous Apache 2.0, MIT, ou licences personnalisées — ce qui n'est pas la même chose qu'open source au sens plein (poids plus données d'entraînement plus code ; seuls OLMo 2, BLOOM et Soofi S sont vraiment qualifiés). Et pour les gros modèles, la taille signifie deux nombres, pas un seul : les paramètres totaux (ce que vous stockez) contre les paramètres actifs par jeton (ce que vous calculez), car chaque modèle à cette échelle est un mélange d'experts épars (Mixture-of-Experts).
La pointe double tous les 13 mois
Le maximum courant de la taille des modèles à poids ouverts est étonnamment régulier : BLOOM 176 Md (2022) → Falcon-180B → Grok-1 314 Md → Llama 3.1 405 Md → DeepSeek-V3 671 Md → Kimi K2 1 000 Md (juillet 2025) → DeepSeek v4 1 600 Md → Kimi K3 2 800 Md (la semaine dernière). Un ajustement exponentiel sur ces points de pointe donne ×1,9 par an — un doublement tous les ~12,8 mois — avec R²=0,91. En extrapolant, le plus grand modèle ouvert franchit 5 000 Md début 2028 et 10 000 Md un an plus tard. La sortie ouverte promise de Qwen3.8 à 2 400 Md se placerait presque exactement sur la courbe.
La sortie médiane s'est déplacée elle aussi : 65 Md (2023) → 90 Md (2024) → 235 Md (2025) → 295 Md (2026). Le basculement des poids lourds ne concerne pas que la pointe — toute la distribution a glissé vers le haut.
Les ciseaux de la parcimonie — pourquoi « poids gratuits + API payante » fonctionne
Voici le mécanisme qui rend les poids ouverts à l'échelle du billion économiquement rationnels plutôt que charitables. Depuis début 2024, les paramètres totaux des grands MoE ouverts ont crû d'environ 16×. Les paramètres actifs n'ont pas bougé : ils sont restés dans une bande étroite d'environ 30 à 55 Md pendant toute cette période. Grok-1 activait 27 % de ses poids par jeton ; DeepSeek-V3 a ramené cela à 5,5 % ; les modèles de la classe billion de 2026 tournent à ~3 % ; Kimi K3 active 1,8 % — 50 Md sur 2 800 Md.
Le coût de service évolue avec les paramètres actifs, si bien qu'un modèle de 2 800 Md coûte à peu près ce que coûte un modèle dense de 50 Md par jeton à faire tourner — mais presque personne d'autre ne peut se permettre les ~1,4 To de mémoire d'accélérateur nécessaires pour stocker les poids. Ce qui signifie qu'un laboratoire peut donner les poids gratuitement et conserver les revenus de l'API : l'ouverture comme jeu de marketing et d'écosystème, l'hébergement comme modèle d'affaires. C'est exactement le motif que l'on voit dans les données — K3 à 15 /3,48 $ par million](https://www.swfte.com/blog/ai-api-pricing-trends-2026) — et c'est pourquoi « comparable au fermé, mais disponible via API » n'est pas une contradiction. C'est la conception même.
Et ils sont comparables désormais : K2.6 égale GPT-5.5 sur SWE-Bench Pro à un coût inférieur de 80 %, LongCat-2.0 le bat carrément (59,5 contre 58,6), K3 se classe troisième sur GDPval derrière seulement Fable 5 Max et GPT-5.6 Sol Max — devant Opus 4.8. Un suivi indépendant situe les modèles ouverts à ~90 % de la capacité fermée pour ~6× moins cher par appel, avec les modèles ouverts chinois routant ~18 000 milliards de jetons par semaine contre 5 500 milliards pour les modèles fermés américains.
Le palier du billion, de zéro à catégorie en douze mois
Aucun modèle ouvert n'avait franchi 1 000 Md avant juillet 2025. Depuis : huit — Kimi K2, K2 Thinking, K2.5, K2.6, K2.7-Code, DeepSeek v4, LongCat-2.0, et K3, avec Inkling à 975 Md à un cheveu près, et Qwen3.8 (2 400 Md) promis.
Mais peut-on vraiment faire tourner tout ça ?
Classons chaque sortie de langage ouverte selon le matériel le moins cher pouvant raisonnablement la faire tourner en quantification 4 bits (~0,58 Go par milliard de paramètres, comme règle de base : une RTX 4090 de 24 Go tient ~32 Md au total, une 5090 de 32 Go ~48 Md ; un MoE épars tourne à vitesse utilisable sur CPU seulement si son nombre de paramètres actifs est de quelques milliards — il faut toujours de la RAM pour tous les poids, mais le calcul par jeton est faible) :
2026 est un haltère : un tiers des sorties ouvertes tient sur une seule carte RTX, un tiers nécessite un centre de données, et le milieu multi-GPU s'est effondré de 73 % (2024) à 24 % (2026). L'extrémité locale a désormais sa propre architecture — le MoE de périphérie (edge MoE), né cette année : ~30 Md au total avec ~3 Md actifs. Qwen3.6-35B-A3B fait 70 à 118 tok/s en 4 bits sur une RTX 5090 ; Soofi S (31,6 Md/3,2 Md, hybride Mamba-2) se quantifie à ~18 Go — ce qui correspond à un GPU de 24 Go ou une machine CPU avec 32 Go de RAM ; DiffusionGemma 26 Md nécessite 16 Go de VRAM ; Gemma 4 31 Md et Ministral 3 complètent cette catégorie. Trois milliards de paramètres actifs représentent un calcul suffisamment faible pour que l'inférence CPU cesse d'être une plaisanterie — les poids se logent dans de la RAM ordinaire et le travail par jeton est à la portée d'un ordinateur portable.
Entre les deux pôles, un milieu pour amateurs existe mais il est mince : des quants dynamiques à 1,8–2 bits font tourner Kimi K2.5 sur un Mac Studio M3 Ultra de 512 Go à ~10+ tok/s, et une machine EPYC avec une seule 4090 et ~384 Go de DRAM soutient ~14 tok/s sur un modèle de classe 671 Md en gardant les experts « chauds » sur le GPU et le reste en RAM. Cette astuce plafonne autour de l'échelle de K2. Pour K3, même des quants agressifs atterrissent à 650 Go–1 To — « au-delà de tout plafond matériel grand public, y compris un Mac Studio de 512 Go ».
Ce que dit internet
La discussion en ligne se divise nettement selon ce même haltère :
- La célébration : la vague du billion est réelle, majoritairement chinoise, et se rapproche de la pointe américaine malgré les limites de calcul — VentureBeat sur K3, Latent Space sur Inkling (« le meilleur modèle ouvert américain sous Apache 2.0 »).
- La critique a un nom : « des poids ouverts que vous ne pouvez pas faire tourner » — ouvert en licence, infonctionnel en pratique. L'aperçu de Qwen3.8 avant les poids a tracé la ligne la plus nette : « le rare lancement où le produit est confirmé réel et où chaque affirmation de performance à son sujet est non confirmée ».
- Où se trouve vraiment l'énergie locale : les petits MoE épars. Soofi S est devenu modestement viral pour son débit ; les choix consensuels de r/LocalLLaMA pour une 4090/5090 sont Qwen3.6-35B-A3B, Gemma 4, et Ministral 3 — pas un modèle avec un « T » dans son nom. (Pendant ce temps, l'écosystème débat de savoir si Ollama s'éloigne trop de llama.cpp.)
- Les contrepoids : le UK AISI mesure que les modèles ouverts de pointe accusent seulement 4 à 7 mois de retard sur la capacité cyber de pointe, ce qui maintient le débat sur la sécurité brûlant (TechCrunch : « OpenAI a peur des modèles à poids ouverts. Les États-Unis devraient-ils l'être aussi ? ») ; des critiques pointent l'« open-washing » (des poids sans données ni code), le durcissement des licences, et la sortie discrète de Meta des poids ouverts avec Muse Spark.
Prédictions
- Le total en billion devient le niveau phare ouvert standard d'ici mi-2027. Zéro → deux → cinq par semestre, les poids complets de K3 arrivent le 27 juillet, la sortie ouverte de Qwen3.8 est promise.
- ~5 000 Md en pointe ouverte début 2028, les actifs restant sous ~100 Md. La contrainte contraignante devient la mémoire pour stocker les poids, pas le calcul pour les faire tourner — ce qui renforce le modèle poids-gratuits/API-payante, car auto-héberger le modèle phare reste hors de portée pour presque tout le monde.
- L'haltère s'élargit. Attendez-vous à ce que chaque grand laboratoire livre la paire : un modèle phare à l'échelle du billion pour l'API et un MoE de périphérie à ~30 Md/3 Md actifs pour la communauté. Le milieu 100–700 Md continue de s'amincir — trop gros pour un GPU et trop petit pour être le meilleur.
- L'inférence CPU devient courante pour la catégorie de périphérie. À ~3 Md actifs, le goulot d'étranglement est la capacité RAM, pas les FLOPs. Un ordinateur portable de 32 Go fait déjà tourner un MoE de classe 30 Md aujourd'hui ; la DDR6 et le déchargement NPU rendront cela banal d'ici 2027.
- L'écart de parité se referme par le bas, pas par le haut. Les modèles ouverts gagnent déjà en volume agentique/codage ; les laboratoires fermés conservent la couronne du raisonnement (Opus, GPT-5.x Pro, Gemini Deep Think). Cette division — chevaux de trait ouverts, raisonnement de pointe fermé — survit à 2027.
Les mises en garde honnêtes : neuf points de pointe constituent un petit échantillon pour un ajustement, neuf des 102 sorties ouvertes ont des tailles non divulguées (tous des lancements de produits), la règle de mémoire en 4 bits est une règle empirique qui ignore la surcharge du contexte/cache KV, et toute l'extrapolation suppose que l'offre de calcul — contrôles à l'exportation, disponibilité des ASIC — ne fait pas dévier la courbe. LongCat-2.0 s'est entraîné sur 50 000 Huawei Ascend précisément parce que cette hypothèse est fragile.
Méthode : sorties à poids ouverts du jeu de données de l'arcade (102 après les ajouts d'audit), nombres de paramètres collectés par modèle (93 résolus ; les tailles sont désormais stockées dans le jeu de données), ajustement de la pointe par moindres carrés log-linéaires sur les points de maximum courant, catégories de matériel en quantification 4 bits de style Q4_K_M. Enquête de sentiment en ligne au 21 juillet 2026 — sources clés liées dans le texte.