Meta a lancé aujourd'hui Muse Glimmer : un modèle à poids ouverts de 30 milliards de paramètres, sous Apache 2.0, conçu pour exécuter des workflows agentiques en local sur un seul GPU grand public ou un Mac. Pris isolément, c'est une sortie de petit modèle solide et bien spécifiée. Ce qui mérite un billet, c'est la phrase posée juste à côté : Meta annonce que Muse Spark 1.2 — le modèle que ce blog couvrait fermé il y a cinq jours — va lui aussi passer à poids ouverts.
Ce qu'est réellement Glimmer
Muse Glimmer est un modèle dense — pas un MoE — construit à partir d'un décodeur texte de 27,9 Md, d'un vision transformer de 1,9 Md, et d'un projecteur multimodal à activation GELU, pour environ 30 Md de paramètres au total. Il accepte du texte et des images entrelacés : un agent bâti dessus peut donc lire une capture d'écran ou un graphique en même temps que la conversation, et pas seulement le texte qui les décrit.
L'attention du modèle de langage suit un motif répété (fenêtre glissante, fenêtre glissante, fenêtre glissante, attention complète) sur 52 couches — trois couches d'attention locale bon marché pour une couche d'attention complète, celle-ci utilisant NoPE (pas d'encodage positionnel explicite) plutôt que RoPE. C'est un arbitrage de coût délibéré : l'essentiel du réseau fait de l'attention à courte portée, et seule une couche sur quatre paie le prix du contexte global. La fenêtre de contexte dépasse 128K tokens.
L'autre vraie pièce d'ingénierie est DFlash, un petit réseau « rédacteur » compagnon livré aux côtés du modèle principal. DFlash propose un bloc entier de 16 tokens par passe avant ; le modèle principal vérifie le bloc en parallèle, conservant ce qui est correct et corrigeant ce qui ne l'est pas, plutôt que de générer token par token. Meta annonce un décodage 3,1× plus rapide sur une RTX 5090, 1,8× sur un M5 Max, 1,5× sur un M4 Max — le gain se réduit sur les puces Apple, ce qui est cohérent : la technique rapporte d'autant plus qu'on dispose de parallélisme GPU à consacrer à la vérification des blocs.
L'entraînement est une distillation, et le professeur est Muse Spark. Le pré-entraînement a utilisé une distillation de logits directement sur les sorties de Muse Spark, avec un mélange de données proche de celui du professeur. Le mid-training a ajouté des données à contexte plus long, plus orientées agent, avec des traces de raisonnement plus riches. Le post-entraînement a combiné du fine-tuning supervisé avec de la distillation on-policy et du RL sur les domaines généraux, de raisonnement, de code et d'agentique. C'est le même instinct que Muse Spark 1.1 générant et notant les données d'entraînement de son successeur, appliqué cette fois à une classe de taille plutôt qu'à une génération de modèle : le modèle phare que Meta vient de garder fermé est ce qui a formé le modèle que Meta vient d'ouvrir. Meta indique aussi que Glimmer a été évalué selon son propre Advanced AI Scaling Framework avant cette sortie — un garde-fou interne nommé pour les sorties à poids ouverts, de la même nature que le Preparedness Framework d'OpenAI pour les seuils de capacité, appliqué ici pour justifier une sortie ouverte plutôt que pour justifier une sortie tout court.
En pleine précision, le modèle de 30 milliards de paramètres réclame plus de 55 Go de mémoire — aucun GPU grand public n'en dispose. Meta quantifie les poids à environ 4 bits, réduisant le modèle de langage à moins de 20 Go, ce qui laisse assez de marge pour que le cache KV, l'encodeur de perception et le rédacteur DFlash quantifié tournent ensemble dans une carte de 24 à 32 Go. Meta affirme que cette compression n'entraîne qu'une dégradation minime, voire nulle, sur les tâches agentiques ; l'affirmation vient du même éditeur que les benchmarks ci-dessous, et appelle la même réserve.
Performances : une majorité relative, pas un raz-de-marée
La fiche modèle de Meta publie 24 lignes de benchmarks couvrant les tâches agentiques générales, le code agentique, la compréhension multimodale, la sécurité et le raisonnement général — évaluées au réglage High Reasoning de Glimmer face à Gemma4-31B et Qwen3.6-27B en Thinking Mode, donc les trois sont lus dans leur configuration la plus forte. Le tableau qui en ressort est plus intéressant qu'un simple « Glimmer gagne » :
| Catégorie | Benchmark | Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| Agentique générale | MCP Atlas | 75,5 | 54,2 | 62,5 |
| Agentique générale | GAIA2 | 43,3 | 36,4 | 40,0 |
| Agentique générale | OSWorld-Verified | 65,9 | 58,5 | 75,6 |
| Agentique générale | SkillsBench (avec compétences) | 44,3 | 32,4 | 46,6 |
| Code agentique | SWE-Bench Pro | 51,2 | 36,9 | 50,2 |
| Code agentique | SWE-Bench Verified | 76,0 | 66,6 | 77,2 |
| Code agentique | TerminalBench 2.1 | 51,7 | 43,4 | 60,7 |
| Multimodal | OmniDocBench v1.5 | 75,8 | 72,5 | 77,8 |
| Sécurité | Siren AgentDojo (taux de succès d'attaque, plus bas = mieux) | 28,4 | 25,6 | 40,3 |
| Raisonnement | GPQA Diamond | 83,5 | 85,7 | 84,2 |
| Raisonnement | AA-LCR | 80,0 | 68,3 | 73,3 |
Sur l'ensemble des 24 lignes publiées, Glimmer arrive en tête sur 12, Qwen3.6-27B sur 8, Gemma4-31B sur 4. C'est un vrai avantage, pas un arrondi — mais ce n'est pas le raz-de-marée que suggéreraient, pris isolément, les deux benchmarks mis en avant dans le billet d'annonce de Meta (MCP Atlas, SWE-Bench Pro), et la répartition est lisible. Les victoires de Glimmer se concentrent sur l'achèvement de tâches agentiques de bout en bout et le raisonnement général — exactement ce pour quoi un modèle distillé d'un modèle phare sur des données riches en agentique et en raisonnement devrait exceller. Celles de Qwen3.6-27B se concentrent sur l'exécution soutenue et vérifiée — OSWorld-Verified, SWE-Bench Verified précisément plutôt que la variante Pro plus bruitée, TerminalBench, l'analyse de documents — le genre de tâches longues où l'essentiel est de ne pas dérailler, et où un modèle ouvert depuis plus longtemps a simplement pu bénéficier de plus d'itérations et d'un examen critique plus nourri. Et Gemma4-31B, bien qu'à la traîne presque partout ailleurs, remporte le benchmark de résistance aux attaques et le benchmark de pure connaissance le plus difficile (GPQA Diamond), ce qui suggère un point différent sur l'arbitrage sécurité/capacité plutôt qu'un modèle strictement plus faible.
Panel choisi par l'éditeur, chiffres produits par l'éditeur : la réserve habituelle sur tout graphique auto-évalué. Reste qu'un tableau de 24 lignes assumant des défaites inspire davantage confiance que les deux lignes retenues dans le billet d'annonce — et qu'il gagne à être lu en entier plutôt qu'en morceaux choisis.
La phrase qui compte plus que le modèle
Il y a cinq jours, ce blog couvrait Muse Code et Muse Spark 1.2 — le premier modèle publié par Alexandr Wang à la tête de la ligne de codage de Meta, sorti sans aucune option à poids ouverts, complétant ce que le jeu de données de l'arcade suivait déjà comme un revirement par rapport à l'identité de Meta à l'ère Llama, remontant à OPT-175B en 2022.
Aujourd'hui, Meta a déclaré quelque chose — encore faut-il être précis sur quoi, car cela ne vient pas de l'essai. L'essai de Zuckerberg lui-même, « The Future is for Everyone », ne s'engage qu'en termes généraux : « Maintenant que Meta Superintelligence Labs est opérationnel, nous allons reprendre la publication de certains modèles open source bientôt. » Muse Spark 1.2 n'y est nommé nulle part. L'engagement précis est venu le même jour, sur X, des deux personnes qui ont réellement le pouvoir de le prendre : Zuckerberg lui-même — « Aujourd'hui nous ouvrons aussi les poids de Muse Glimmer... Bientôt nous publierons aussi les poids de Muse Spark 1.2, notre dernier modèle de fondation » — et Alexandr Wang, qui dirige le laboratoire qui l'a construit — « grande annonce aujourd'hui : nous allons publier une version à poids ouverts de muse spark 1.2 bientôt. » C'est le PDG de Meta et le créateur même de Spark, sur la place publique, qui le nomment. Reste que : aucune licence, aucune date, aucun nombre de paramètres — « bientôt » porte, à lui seul, tout le poids des deux citations. Il faut noter que Zuckerberg avait déjà été interrogé directement sur Spark 1.2 en particulier, une première fois : sur X, le jour même où il sortait fermé, il avait répondu à une question sur les poids ouverts par « j'aurai bientôt plus à partager là-dessus ». Cinq jours est une lecture plausible de « bientôt ».
Traitez cela comme ce blog traite toute annonce non encore livrée : une intention déclarée, pas une sortie. L'historique récent de Meta comprend des modèles restés ouverts (Muse Spark, LLaMA), des modèles sortis fermés et restés fermés (Muse Image, Muse Video, Spark 1.1), et maintenant un modèle sorti fermé et qui, sur la parole de l'entreprise, ne le restera pas. La bonne entrée pour « Muse Spark 1.2 : ouvert » est le jour où les poids atterrissent sur Hugging Face avec une licence attachée, pas le jour où quelqu'un dit que ça arrive.
L'autre moitié de l'essai
L'annonce sur les poids ouverts ne tombe pas dans le vide. La tribune de Zuckerberg l'inscrit explicitement dans un positionnement concurrentiel face aux laboratoires chinois à poids ouverts — Alibaba, DeepSeek, Moonshot — arguant que « les laboratoires étrangers détiennent actuellement plusieurs avantages » parce que les laboratoires américains font face à des restrictions sur les données d'entraînement que leurs concurrents n'ont pas, et que « la politique américaine doit réduire cette friction supplémentaire si nous voulons que les modèles open source américains prennent la tête sur la durée ». C'est le même combat que ce blog couvrait en juillet, quand une interdiction envisagée à Washington visant les modèles chinois à poids ouverts avait suscité une coalition industrielle rapide et inhabituelle contre elle. La tribune de Zuckerberg défend l'autre versant du même combat politique : non pas « bloquez leurs modèles ouverts », mais « assouplissez les règles qui pèsent sur les nôtres, pour que nous puissions les concurrencer sur le terrain de l'ouverture ».
La tribune annonce également un nouveau « Future Is For Everyone Fund » pour soutenir ce qu'il appelle un « pacte communautaire » autour des chantiers de datacenters de Meta — emplois locaux, investissement dans les écoles, maintien de prix de l'énergie bas — illustré par un exemple concret : les enseignants de Richland Parish, en Louisiane, ont reçu cette année une prime de 50 000 $ grâce aux recettes fiscales générées par l'investissement de Meta, et le directeur académique cité affirme que des enseignants d'autres États viennent désormais s'y installer. (Des articles extérieurs ont associé à ce fonds un montant d'un milliard de dollars ; la tribune, elle, énonce l'engagement sans le chiffrer.) Modèle ou non, c'est un engagement séparé intégré dans la même annonce, ce qui est en soi un signal sur le poids politique que cette annonce est censée porter.
Deux autres passages de la tribune méritent d'être isolés, car ils recoupent directement des fils que ce blog suit déjà.
Sur la distillation, Meta prend parti. En plaidant pour une inflexion de la politique américaine qui permettrait aux modèles ouverts américains de prendre la tête, la tribune affirme sans détour : « Certains ont tenté de présenter la distillation comme nuisible, mais je pense qu'il est important de protéger le principe selon lequel on peut apprendre de tout ce qu'on peut observer... les États-Unis ne pourront pas prendre la tête si nous nous imposons des restrictions sur ce terrain. » C'est une prise de position directe dans le différend même que ce blog couvrait en juillet — l'accusation selon laquelle Kimi K3 aurait été entraîné par distillation non autorisée depuis un modèle fermé, et la riposte rapide de l'industrie contre un projet d'interdiction en partie fondé sur cette accusation. Meta prend désormais position pour dire que l'accusation elle-même repose sur un principe qui ne devrait pas être imposé.
Sur la gouvernance, Meta se donne un garde-fou. La tribune indique que l'entreprise confie à son conseil d'administration indépendant le pouvoir d'approuver les critères de sécurité applicables à la publication des modèles, et de vérifier que chaque publication les respecte — le même type de garde-fou interne que l'Advanced AI Scaling Framework de Glimmer lui-même, décrit plus haut, ou que le Preparedness Framework d'OpenAI, mais remonté d'un niveau, passant du processus d'une équipe technique à un contrôle du conseil sur le PDG lui-même. La formule de Zuckerberg pour expliquer pourquoi : « Je ne pense pas qu'il soit dans mon intérêt, dans celui de Meta, ou dans celui du monde, que moi ou quiconque d'autre soit l'unique décideur sur la façon dont la superintelligence est déployée. »
À surveiller ensuite
- Attendez les poids de Spark 1.2, pas la tribune. Entre « nous allons ouvrir ce modèle » et un checkpoint téléchargeable assorti d'une vraie licence, l'écart a déjà été de cinq jours une fois cette année ; rien ne dit qu'il se refermera vite.
- Sur quel barreau de l'ouverture va-t-il atterrir ? « Ouvert » ne désigne pas une chose unique : la licence à seuil de Llama, l'Apache 2.0 de Glimmer, ou quelque chose entre les deux, ce sont trois engagements très différents sous un même mot.
- Glimmer restera l'essentiel, quoi qu'il advienne de Spark 1.2. Un véritable modèle agentique local sous Apache 2.0, avec des chiffres qui tiennent face à Gemma4 et Qwen3.6, change ce qui tourne dès aujourd'hui sur un GPU grand public. Une promesse de publication future, elle, ne change rien tant qu'elle n'est pas tenue.