Hugging Face a publié son rapport d'été sur l'état des modèles ouverts, couvrant janvier à juillet 2026 — la plateforme a franchi un million de datasets et est passée de 2,43 à 2,96 millions de dépôts de modèles publics en sept mois. Avant les conclusions, la forme qui les sous-tend, que le rapport énonce clairement : 85,6 % des modèles ont moins de 200 téléchargements cumulés, et 1,5 % des dépôts concentrent 99,2 % de tous les téléchargements. Tout ce qui suit se passe à l'intérieur de cette asymétrie, et la note méthodologique du rapport — l'activité du Hub est une lentille, pas le marché de l'IA — mérite de voyager avec chaque chiffre qu'on en cite.
Le plafond de la frontière est chinois, mois après mois
Presque chaque mois de 2026, le plus grand modèle ouvert d'un laboratoire chinois dépassait en taille tout ce que les laboratoires américains publiaient en propre : le plafond mensuel chinois a couru de 754B à 2,78T de paramètres (Kimi K3 au sommet), tandis que celui de l'Amérique est resté sous 130B cinq mois sur sept. Les exceptions sont parlantes par leur rareté — Nemotron 3 Ultra de NVIDIA (561B), Inkling de Thinking Machines (952B), Trinity-Large d'Arcee (399B) — et le rapport est direct sur le reste : la plupart des sorties américaines au-dessus de 100B cette année sont des conversions et dérivés de modèles chinois, pas de nouveaux modèles. C'est la tendance que nous avions appelée le basculement des poids lourds en juillet, désormais étayée par sept mois complets de données.
La découverte miroir : l'open source américain n'a pas rétréci, il a changé de mains. Les deux éditeurs les plus prolifiques de nouveaux modèles ouverts cette année sont AMD et NVIDIA — plus de 200 nouveaux dépôts chacun, devant tous les laboratoires de modèles — parce qu'un modèle optimisé pour votre matériel et librement disponible est la preuve la plus claire que le matériel fonctionne. Google et Meta, les entreprises qui ont défini la publication de modèles ouverts, se classent désormais bien en dessous des fabricants de puces. L'open source est passé des laboratoires de modèles aux entreprises de matériel et d'infrastructure, et le rapport note le même schéma en sens inverse en Chine, où les modèles ouverts sont de plus en plus optimisés pour les puces domestiques.
L'attention et l'adoption ne partagent qu'un seul modèle
Le geste analytique le plus net du rapport : prendre les 25 premiers dépôts par téléchargements 2026 et les 25 premiers par likes. Un seul modèle figure dans les deux listes. Pas un seul modèle publié en 2026 n'atteint le top 25 des téléchargements ; treize de ces vingt-cinq datent de 2022. L'increvable modèle d'embeddings all-MiniLM-L6-v2 a été téléchargé 1,55 milliard de fois en sept mois contre 5 156 likes ; Kimi-K3 a récolté environ 60 téléchargements par like. Le cadrage du rapport mérite d'être adopté tel quel : les likes mesurent ce qui enthousiasme le domaine, les téléchargements mesurent ce dont il dépend actuellement, et traiter l'un comme un substitut de l'autre est l'erreur la plus courante de la couverture du Hub — « y compris nos propres travaux antérieurs », ajoutent-ils, le genre d'autocorrection qui mérite d'être crédité. La même discipline produit la conclusion sur les petits modèles qui continue de tenir : parmi les modèles qui déclarent un nombre de paramètres, ceux sous 1B prennent 83 % des téléchargements cumulés (61,5 % du total non restreint — 26 % des téléchargements vont vers des dépôts sans métadonnées de paramètres), tout ce qui dépasse 100B en prend 1 %, et se restreindre aux téléchargements 2026 n'y change presque rien.
La division stratégique, chiffrée
Les portefeuilles de tailles laboratoire par laboratoire mettent des chiffres sur une division que ce blog décrivait qualitativement : Moonshot, MiniMax, Xiaomi et Z.ai ne publient presque rien sous 70B — des portefeuilles frontière-uniquement misant sur la position aux benchmarks et la demande API — tandis que Tencent (59 sorties) et Qwen d'Alibaba (51) couvrent toutes les bandes de taille depuis moins de 1B. La répartition des téléchargements montre à quel point ces paris encaissent différemment : le volume 2026 de MiniMax est à 100 % sur des modèles de plus de 70B et celui de Moonshot à 88 %, tandis que les 519M de téléchargements de BAAI sont à 98 % sous 1B — même pays, extrémités opposées du spectre de tailles, les deux viables. L'écart de gain entre les stratégies reste saisissant : le portefeuille frontière-uniquement de Moonshot a enregistré 37M de téléchargements cette année ; la famille pleine-gamme de Qwen en a enregistré 2,05 milliards — environ 55 fois plus. Et la position de Qwen se cumule au-delà de ses propres sorties : 151 448 dérivés communautaires, 2,6 fois toute l'empreinte de Meta, en croissance de 180 à 210 nouveaux dépôts par jour. Sur les 28 531 conversions GGUF de modèles Qwen sur le Hub, Qwen lui-même en a publié 54 — l'écosystème est construit par la communauté au-dessus d'un laboratoire qui a fourni régularité, couverture et Apache 2.0. Les données de licences tuent la contre-histoire évidente : sur 178 sorties chinoises au-dessus de 20B cette année, 81 % sont Apache ou MIT et zéro porte des conditions non commerciales — plus permissif que la bande américaine équivalente (29 % permissif, 30 % ne déclarant rien). Quel que soit le modèle économique, ce n'est pas le revenu de licence.
La couche de quantification s'est décentralisée après l'arrivée de llama.cpp
Le graphique mensuel des GGUF porte un basculement structurel que le texte du rapport ne fait qu'effleurer : après que l'équipe ggml/llama.cpp a rejoint Hugging Face en février, les nouveaux dépôts GGUF issus d'éditeurs communautaires individuels ont environ doublé — de 2 698 en février à 5 555 en juin — tandis que la production des comptes de quantification en masse a été divisée par deux sur la même période, de 2 062 à 1 297. La couche qui rend les modèles au billion de paramètres exécutables localement a cessé d'être le produit de quelques convertisseurs industriels pour devenir un travail largement distribué, ce qui compte parce que cette couche est la raison même pour laquelle une stratégie de sortie frontière-uniquement atteint qui que ce soit : l'inférence locale signifie désormais un MoE au billion de paramètres réparti sur des machines grand public, et elle tourne de façon disproportionnée sur Qwen — 39,6M de téléchargements GGUF par mois contre 20,8M pour Gemma et 7,5M pour Llama, alors même que les dépôts GGUF dérivés de Llama dépassent légèrement en nombre ceux de Qwen. Même rayonnage, un cinquième du trafic.
Les agents sont désormais une classe d'utilisateurs mesurable
La section qui n'aurait pas pu exister en mars : un nouveau dataset enregistre le jeton client que les agents de codage envoient quand ils appellent le Hub, rendant le trafic d'agents visible pour la première fois. Deux découvertes. Le marché n'a pas de titulaire — Claude Code détenait 67,8 % du trafic d'agents en avril, 6,4 % en mai, et 44,4 % en juillet, des oscillations qu'aucun marché d'utilisateurs humains ne produit. Et la ligne qui croît le plus vite est « non enregistré » : 59,8 % du trafic d'agents en mai venait de harnais qu'aucun registre n'avait encore nommés, avec plus d'une douzaine de nouveaux identifiants clients apparus en quatre mois. Hugging Face a passé l'année à construire pour ce lecteur — des papiers lisibles par machine, un point d'accès agents.md sur chaque Space, un outil de système de fichiers MCP — et le rapport referme aussi la boucle sur une histoire que nous avions couverte à chaud : l'intrusion de juillet leur est arrivée à eux, et quand leur équipe a tenté d'analyser le code d'attaque capturé, les modèles fermés de pointe ont décliné le travail pour raisons de sécurité. L'analyse a été achevée sur un GLM-5.2 ouvert et quantifié tournant sur leur propre infrastructure — la tension fermé-contre-ouvert sur le cyber que cette base de données suit depuis tout le mois, comprimée en une seule réponse à incident.
À surveiller
- Si l'écart américain à l'échelle de la frontière se referme ou s'institutionnalise. Trois modèles américains originaux au-dessus de 100B en sept mois est un nombre qui se compte ; le rapport d'hiver dira si c'était un creux ou la nouvelle norme.
- Le tournant de la monétisation que le rapport lui-même prédit. Il s'attend à ce que l'industrie évolue vers « des voies de monétisation plus claires de l'adoption open source » — la première sortie chinoise à l'échelle de la frontière livrée sous des conditions moins permissives qu'Apache marquerait précisément ce tournant.
- La part du trafic d'agents une fois le registre à jour. La moitié de l'histoire est actuellement dans la ligne « non enregistré » ; nommer ces harnais révélera si l'usage par les agents se concentre ou se fragmente — et le propre pari du rapport est que la prochaine édition « pourrait aussi être très différente ».
Références : Hugging Face — State of Open Models, Summer 2026 · couverture liée : Le basculement des poids lourds : les poids ouverts passent à l'échelle du billion · Kimi K3 : le plus grand modèle en poids ouverts à ce jour · La première brèche pilotée par l'IA venait de l'intérieur d'une évaluation · GLM-5.3 · Ouvert jusqu'où ? · Qwen3.8-27B · Frontier Arcade : tendances et prédictions