La division InclusionAI d'Ant Group a mis en ligne les poids de Ling-3.0-tiny sur Hugging Face : un mixture-of-experts de 7,9B de paramètres qui n'en active que 1,3B par token, avec une fenêtre de contexte de 256K, des modes commutables Thinking/Instant, et des checkpoints BF16, FP8 et INT4 pour tout, du datacenter à l'ordinateur portable. La fiche API était apparue discrètement le 6 août — gratuite sur OpenRouter et Vercel — et les poids ont suivi environ cinq jours plus tard. Si cette chorégraphie de sortie vous dit quelque chose, c'est normal : Ling-3.0-flash a fait exactement pareil en juillet, API le 23, poids sous licence MIT le 26. C'est désormais un schéma, et il mérite d'être nommé.
L'architecture : l'attention de Kimi, le modèle d'Ant
La partie techniquement intéressante de toute la génération Ling 3.0 est la pile d'attention. Tiny entrelace KDA — Kimi Delta Attention, le design d'attention linéaire de Moonshot — avec MLA (multi-head latent attention) dans un ratio 3:1 : trois couches d'attention linéaire pour une couche d'attention complète, par bloc de quatre couches. Flash, le grand frère de 124B, utilise la même recette en 5:1. C'est cet hybride qui rend un contexte de 256K plausible sur un modèle aussi petit : l'attention linéaire empêche le coût mémoire du long contexte d'exploser, les couches MLA périodiques empêchent la qualité de récupération de s'effondrer — le même pari que font les hybrides Mamba, avec le même mode de défaillance connu à surveiller sur le rappel précis à longue portée.
Notez ce qui se passe entre laboratoires : l'innovation d'attention d'un laboratoire chinois est désormais une infrastructure porteuse dans la gamme de modèles d'un autre laboratoire chinois, quelques mois après publication. KDA est un design de Moonshot (Kimi) ; Ant l'a adopté dans toute la famille Ling 3.0. C'est le volant d'inertie de l'écosystème ouvert que l'article tendances ne cesse de pointer — la part de 56 % de poids ouverts en Asie n'est pas qu'une statistique de sorties, c'est la raison pour laquelle les idées d'architecture s'y composent à cette vitesse.
La sparsité est l'autre gros titre : 128 experts routés, 8 routés plus 1 partagé actifs par token, soit un ratio total/actif de 6:1 à une taille où le MoE n'existait à peine il y a un an. Un modèle à 1,3B actifs avec des checkpoints INT4 vise du matériel réellement modeste — il concurrence frontalement l'étage des agents locaux LFM2.5 et TwiL-LM, pas quoi que ce soit sur un leaderboard.
Et, fait inhabituel, la fiche chiffre cette promesse en termes de matériel plutôt qu'en impressions : validation sur DGX Spark de NVIDIA, MacBook Apple Silicon et Mac mini, avec un débit FP8 de 100 à 105 tokens/s sur DGX Spark et 86 à 90 tokens/s sur un MacBook M4 Pro, pour environ 8,34 GiB de mémoire de pointe à 8K de contexte. Artificial Analysis mesure indépendamment plus de 160 tokens/s en service, avec ~18 secondes de bout en bout pour une réponse de 500 tokens, temps de réflexion inclus. Ce sont les chiffres dont un acheteur d'agent local a réellement besoin — des tokens par seconde sur la machine qu'il possède, et si la taxe de latence du mode réflexion tient dans une boucle interactive — et la plupart des fiches de cet étage ne les publient pas.
Ce qu'on ne peut pas encore dire
Deux lacunes honnêtes. D'abord, la capacité n'avait pas de prix affiché au lancement : pendant la semaine API-seule, les seuls chiffres publiés étaient des scores composites — Artificial Analysis Intelligence Index 25, Agentic Index 16 — sans table par benchmark derrière. Cette lacune s'est depuis refermée : la fiche Hugging Face porte désormais une table complète de 15 benchmarks, décodée dans la mise à jour ci-dessous. Ensuite, la licence des poids de tiny reste à lire : flash est sorti en MIT, les Ling précédents étaient en MIT, et rien n'indique qu'Ant change de cap — mais « le frère était en MIT » est une attente, pas une licence. Vu à quel point la couverture de ce mois-ci a tourné autour de ce qu'une sortie « ouverte » permet exactement commercialement, le fichier de licence compte plus que l'annonce.
Signalons aussi le décalage de la presse : l'essentiel de la couverture secondaire de cette semaine dit encore que les poids de tiny sont « promis mais pas livrés » — la mise en ligne du dépôt Hugging Face semble avoir pris de vitesse les articles. La source primaire bat les agrégateurs de plusieurs jours, une fois de plus.
Mise à jour (11 août) : la table de la fiche, décodée
La fiche du modèle publie désormais une table de 15 benchmarks, tous les modèles en mode Thinking, face à Qwen3.5-4B, Qwen3.5-9B, Gemma-4-E4B-it et Gemma-4-12B-it. Lue comme un tableau des scores, tiny perd : il mène sur 4 des 15, Qwen3.5-9B sur 4, et Gemma-4-12B sur 6. Ant a publié une table que son modèle ne domine pas — ce qui, comme pour la fiche de Glimmer chez Meta, est exactement ce qui rend la table digne d'être lue. Le profil qu'elle dessine est cohérent :
- Les victoires sont les victoires agentiques — et elles ne sont pas serrées. GDPval v2-AA à 772 contre 645 pour le meilleur suivant (Gemma-4-12B), et TAU3-Banking-AA à 20,8 contre 8,7 — 2,4× le second, en notant toutefois les faibles valeurs absolues : chaque modèle de la ligne échoue sur la majorité de ce benchmark. Ajoutez l'appel de fonctions BFCL-v4 (62,72) et Terminal-Bench 2.1 (27,7), tous deux seconds derrière un Qwen qui a 7× les paramètres actifs, et le positionnement « exécutant dans une boucle d'agent » cesse d'être du langage marketing pour devenir ce que la table montre réellement.
- Le savoir est le sacrifice, et le modèle est honnête là-dessus. Une précision AA-Omniscience de 8,52, bon dernier — un modèle à 1,3B actifs ne peut tout simplement pas stocker ce qu'un 12B dense stocke. Mais son taux de non-hallucination est de 69,54, contre 13 à 19 pour les Qwen et Gemma-12B : tiny sait très peu de choses et le dit, là où ses rivaux en savent plus et confabulent le reste. Pour un chatbot, cet échange se lit mal ; pour un exécutant dont le harnais fournira les faits via des outils, l'ignorance calibrée est sans doute la spécification la plus utile.
- La réserve sur le long contexte s'est matérialisée à point nommé. AA-LCR ressort à 58,7 — derrière les deux Qwen et Gemma-12B — malgré la fenêtre de 256K revendiquée. C'est la faiblesse de rappel de l'attention linéaire que nous signalions plus haut, visible dans la table du vendeur lui-même : la pile chargée en KDA achète la fenêtre de contexte à bas prix, et la paie en qualité de récupération sur toute sa longueur.
- Les maths se scindent bizarrement : une vraie victoire sur IMO-AnswerBench (71,03) à côté d'une troisième place sur HMMT — plus cohérent avec une variance sensible à la contamination entre jeux de compétition qu'avec une histoire propre de « bon en maths ».
Les réserves habituelles, aiguisées : l'ensemble de comparaison est celui du vendeur, et le cadrage flatte — opposer 1,3B de paramètres actifs à des rivaux denses de 4 à 12B transforme chaque quasi-égalité en victoire d'efficacité, ce qui est juste en soi mais est aussi précisément l'axe sur lequel Ant a choisi de se battre.
Une note méthodologique de la fiche mérite toutefois d'être créditée : le score Terminal-Bench 2.1 arrive avec son harnais entièrement déclaré — le harnais Terminus 2 par défaut sous protocole Artificial Analysis, un délai de 2 heures, parsing JSON en mode preserve-thinking, moyenne sur 3 exécutions, budget de génération de 32K dans une fenêtre de 256K. Après un mois où les changements de harnais ont déplacé les scores agentiques plus que les générations de modèles, un vendeur qui précise quel harnais a produit le chiffre est exactement la transparence qui manque aux benchmarks agentiques — une petite chose qui devrait être la norme, et ne l'est généralement pas.
Pourquoi la chorégraphie compte
API d'abord, poids ensuite : c'est en train de devenir le schéma de sortie par défaut des laboratoires chinois, et il est rationnel — la semaine d'API gratuite génère données d'usage et attention pendant que les poids se préparent, puis la sortie des poids convertit l'attention en adoption. Mais cela signifie aussi que la date d'annonce et la date d'ouverture divergent : flash a été « publié » le 23 juillet et ouvert le 26 ; tiny a été « publié » le 6 août et ouvert autour du 11. Pour qui suit la part des poids ouverts dans le temps (comme notre jeu de données), la chorégraphie est un piège de mesure : un modèle peut passer tout son cycle médiatique fermé et finir quand même en sortie ouverte. Nous avons daté tiny à son lancement du 6 août et corrigé l'entrée de flash, que notre arcade marquait honnêtement « poids non confirmés » au lancement — ils sont arrivés depuis.
La lecture stratégique est celle que le scénario baissier de l'article tendances ne cesse d'encercler : l'étage des exécutants d'agents sous 10B compte désormais des entrées de Liquid (verrou de revenus), webAI (non commercial), NVIDIA (ouvert sous conditions, depuis ce matin) et Ant (MIT, si le schéma tient). Quatre laboratoires, quatre philosophies de licence, un produit convergent : l'exécutant local bon marché dans la boucle d'agent de quelqu'un d'autre. Quand les écarts de capacité sont aussi durs à mesurer — indices composites, tables du vendeur, aucun harnais commun — la licence est peut-être la spécification la plus lisible de la fiche.
À surveiller
- Le fichier de licence du dépôt Hugging Face. MIT ferait de tiny le modèle le moins entravé de son étage et le choix par défaut évident pour les agents locaux commerciaux. Tout autre choix serait une nouvelle précisément parce qu'il romprait le schéma Ling.
- Une réplication indépendante des victoires agentiques. Les avances de la fiche sur GDPval et TAU3-Banking sont toute la thèse de ce modèle, et elles sont mesurées par le vendeur ; un comparatif tiers en harnais face à Qwen3.5-4B trancherait si le positionnement d'exécutant survit en terrain neutre.
- La diffusion de KDA. Kimi Delta Attention est maintenant dans les modèles de Moonshot et dans toute la gamme 3.0 d'Ant. Si un troisième laboratoire l'adopte ce trimestre, c'est le standard de facto de l'attention linéaire pour l'écosystème ouvert — décidé par l'adoption, pas par la table de benchmarks d'un article.
- La tenue du mode Thinking de tiny face à de vrais harnais. Des modes de raisonnement commutables à 1,3B actifs est une revendication agressive ; le mode de défaillance (des tokens de réflexion qui brûlent de la latence sans acheter de la justesse) se verra d'abord dans les temps de complétion en boucle d'agent.
Références : inclusionAI/Ling-3.0-tiny sur Hugging Face · OpenRouter — Ling 3.0 Tiny · AIToolsReview — Ling 3.0 Tiny · Data Science in Your Pocket — l'architecture de Ling 3.0 Flash · couverture liée : Nemotron 3.5 Lightning · LFM2.5, agents locaux · Les niveaux d'ouverture · Ce que Mamba oublie