Meta a lancé aujourd'hui Muse Glimmer : un modèle en poids ouverts de 30 milliards de paramètres, sous Apache 2.0, conçu pour exécuter des workflows agentiques en local sur un seul GPU grand public ou un Mac. Pris isolément, c'est une sortie de petit modèle solide et bien spécifiée. Ce qui mérite un billet, c'est la phrase posée juste à côté : Meta annonce que Muse Spark 1.2 — le modèle que ce blog couvrait fermé il y a cinq jours — va lui aussi passer en poids ouverts.
Ce qu'est réellement Glimmer
Muse Glimmer est un modèle dense — pas un MoE — construit à partir d'un décodeur texte de 27,9 Md, d'un vision transformer de 1,9 Md, et d'un projecteur multimodal à activation GELU, pour environ 30 Md de paramètres au total. Il accepte du texte et des images entrelacés, si bien qu'un agent bâti dessus peut lire une capture d'écran ou un graphique aux côtés de la conversation, et non seulement du texte qui les décrit.
L'attention du modèle de langage suit un motif répété (fenêtre glissante, fenêtre glissante, fenêtre glissante, attention complète) sur 52 couches — trois couches d'attention locale bon marché pour une couche d'attention complète, celle-ci utilisant NoPE (pas d'encodage positionnel explicite) plutôt que RoPE. C'est un arbitrage de coût délibéré : l'essentiel du réseau fait de l'attention à courte portée, et seule une couche sur quatre paie le prix du contexte global. La fenêtre de contexte dépasse 128K tokens.
L'autre vraie pièce d'ingénierie est DFlash, un petit réseau « rédacteur » compagnon livré aux côtés du modèle principal. DFlash propose un bloc entier de 16 tokens par passe avant ; le modèle principal vérifie le bloc en parallèle, conservant ce qui est correct et corrigeant ce qui ne l'est pas, plutôt que de générer token par token. Meta annonce un décodage 3,1× plus rapide sur une RTX 5090, 1,8× sur un M5 Max, 1,5× sur un M4 Max — le gain se réduit sur silicium Apple, cohérent avec une technique qui rapporte davantage là où l'on dispose de parallélisme GPU à consacrer à la vérification de blocs que là où on n'en a pas.
L'entraînement est une distillation, et le professeur est Muse Spark. Le pré-entraînement a utilisé une distillation de logits directement sur les sorties de Muse Spark, avec un mélange de données proche de celui du professeur. Le mid-training a ajouté des données à contexte plus long, plus orientées agent, avec des traces de raisonnement plus riches. Le post-entraînement a combiné du fine-tuning supervisé avec de la distillation on-policy et du RL sur les domaines généraux, de raisonnement, de code et d'agentique. C'est le même instinct que Muse Spark 1.1 générant et notant les données d'entraînement de son successeur, appliqué cette fois à une classe de taille plutôt qu'à une génération de modèle : le modèle phare que Meta vient de garder fermé est ce qui a formé le modèle que Meta vient d'ouvrir. Meta indique aussi que Glimmer a été évalué selon son propre Advanced AI Scaling Framework avant cette sortie — un garde-fou interne nommé pour les sorties en poids ouverts, de la même nature que le Preparedness Framework d'OpenAI pour les seuils de capacité, appliqué ici pour justifier une sortie ouverte plutôt que pour justifier une sortie tout court.
En pleine précision, le modèle de 30 Md nécessite plus de 55 Go de mémoire — aucun GPU grand public n'en dispose. Meta quantifie les poids à environ 4 bits, réduisant le modèle de langage à moins de 20 Go, ce qui laisse assez de marge pour que le cache KV, l'encodeur de perception et le rédacteur DFlash quantifié tournent ensemble dans une carte de 24 à 32 Go. Meta affirme que cette compression coûte un dégradé minimal voire nul sur les tâches agentiques ; cette affirmation vient du même vendeur que les benchmarks ci-dessous, à lire avec la même réserve.
Performance : une pluralité, pas un raz-de-marée
La fiche modèle de Meta publie 24 lignes de benchmarks couvrant les tâches agentiques générales, le code agentique, la compréhension multimodale, la sécurité et le raisonnement général — évaluées au réglage High Reasoning de Glimmer face à Gemma4-31B et Qwen3.6-27B en Thinking Mode, donc les trois sont lus dans leur configuration la plus forte. Le tableau qui en ressort est plus intéressant qu'un simple « Glimmer gagne » :
| Catégorie | Benchmark | Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| Agentique générale | MCP Atlas | 75,5 | 54,2 | 62,5 |
| Agentique générale | GAIA2 | 43,3 | 36,4 | 40,0 |
| Agentique générale | OSWorld-Verified | 65,9 | 58,5 | 75,6 |
| Agentique générale | SkillsBench (avec compétences) | 44,3 | 32,4 | 46,6 |
| Code agentique | SWE-Bench Pro | 51,2 | 36,9 | 50,2 |
| Code agentique | SWE-Bench Verified | 76,0 | 66,6 | 77,2 |
| Code agentique | TerminalBench 2.1 | 51,7 | 43,4 | 60,7 |
| Multimodal | OmniDocBench v1.5 | 75,8 | 72,5 | 77,8 |
| Sécurité | Siren AgentDojo (taux de succès d'attaque, plus bas = mieux) | 28,4 | 25,6 | 40,3 |
| Raisonnement | GPQA Diamond | 83,5 | 85,7 | 84,2 |
| Raisonnement | AA-LCR | 80,0 | 68,3 | 73,3 |
Sur l'ensemble des 24 lignes publiées, Glimmer arrive en tête sur 12, Qwen3.6-27B sur 8, Gemma4-31B sur 4. C'est un vrai avantage, pas un arrondi — mais ce n'est pas le raz-de-marée que suggéreraient, pris isolément, les deux benchmarks mis en avant dans le billet d'annonce de Meta (MCP Atlas, SWE-Bench Pro), et la répartition est lisible. Les victoires de Glimmer se concentrent sur l'achèvement de tâches agentiques de bout en bout et le raisonnement général — exactement ce pour quoi un modèle distillé d'un modèle phare sur des données riches en agentique et en raisonnement devrait exceller. Celles de Qwen3.6-27B se concentrent sur l'exécution soutenue et vérifiée — OSWorld-Verified, SWE-Bench Verified précisément plutôt que la variante Pro plus bruitée, TerminalBench, l'analyse de documents — le genre de tâches longues, où ne pas dérailler compte, et où un modèle ouvert au passé public plus long a pu simplement bénéficier de plus d'itérations et de scrutin. Et Gemma4-31B, bien qu'à la traîne presque partout ailleurs, remporte le benchmark de résistance aux attaques et le benchmark de pure connaissance le plus difficile (GPQA Diamond), ce qui suggère un point différent sur l'arbitrage sécurité/capacité plutôt qu'un modèle strictement plus faible.
Panel choisi par le vendeur, chiffres exécutés par le vendeur — la même réserve que ce blog applique à tout graphique auto-noté. Mais un tableau de 24 lignes qui comporte des défaites est un document plus digne de confiance que les deux lignes retenues dans le billet d'annonce, et il vaut la peine d'être lu en entier plutôt qu'en surlignage.
La phrase qui compte plus que le modèle
Il y a cinq jours, ce blog couvrait Muse Code et Muse Spark 1.2 — le premier modèle publié par Alexandr Wang à la tête de la ligne de codage de Meta, sorti sans aucune option en poids ouverts, complétant ce que le jeu de données de l'arcade suivait déjà comme un revirement par rapport à l'identité de Meta à l'ère Llama, remontant à OPT-175B en 2022. Ce billet, à la demande directe de la personne pour qui ce blog est écrit, ne se livre pas à un commentaire éditorial sur la signification possible de ce revirement — ce cadrage éditorial a été retiré parce qu'il ne faisait pas partie de ce que Meta avait réellement déclaré ce jour-là.
Aujourd'hui, Meta a déclaré quelque chose. Aux côtés du lancement de Glimmer, Zuckerberg a publié un essai d'une quinzaine de pages, « The Future is for Everyone », confirmant que Muse Spark 1.2 recevra une sortie en poids ouverts. Alexandr Wang est cité dans le même sens. Aucune licence, aucune date, aucun nombre de paramètres pour la version ouverte — seulement l'engagement. Il faut noter que Zuckerberg avait déjà été interrogé directement sur ce point : sur X, le jour même où Muse Spark 1.2 sortait fermé, il avait répondu à une question sur les poids ouverts par « j'aurai bientôt plus à partager là-dessus ». Cinq jours est une lecture plausible de « bientôt ».
Traitez cela comme ce blog traite toute annonce non encore livrée : une intention déclarée, pas une sortie. L'historique récent de Meta comprend des modèles restés ouverts (Muse Spark, LLaMA), des modèles sortis fermés et restés fermés (Muse Image, Muse Video, Spark 1.1), et maintenant un modèle sorti fermé et qui, sur la parole de l'entreprise, ne le restera pas. La bonne entrée pour « Muse Spark 1.2 : ouvert » est le jour où les poids atterrissent sur Hugging Face avec une licence attachée, pas le jour où quelqu'un dit que ça arrive.
L'autre moitié de l'essai
L'annonce sur les poids ouverts ne se produit pas dans le vide. L'essai de Zuckerberg la cadre explicitement comme un positionnement concurrentiel face aux laboratoires chinois en poids ouverts — Alibaba, DeepSeek, Moonshot — arguant que « les laboratoires étrangers détiennent actuellement plusieurs avantages » parce que les laboratoires américains font face à des restrictions sur les données d'entraînement que leurs concurrents n'ont pas, et que « la politique américaine doit réduire cette friction supplémentaire si nous voulons que les modèles open source américains prennent la tête sur la durée ». C'est le même combat que ce blog couvrait en juillet, quand une interdiction envisagée à Washington visant les modèles chinois en poids ouverts avait suscité une coalition industrielle rapide et inhabituelle contre elle. L'essai de Zuckerberg est Meta plaidant l'autre face de ce même combat politique : non pas « bloquez leurs modèles ouverts », mais « assouplissez les règles sur les nôtres pour que nous puissions les concurrencer sur le terrain de l'ouverture ».
L'essai annonce aussi un fonds communautaire d'un milliard de dollars destiné aux communautés situées près des chantiers de datacenters de Meta — un engagement séparé, non lié à un modèle, intégré dans la même annonce, ce qui est en soi un signal sur le poids politique que cette annonce est censée porter.
À surveiller ensuite
- Attendez les poids réels de Spark 1.2, pas l'essai. L'écart entre « nous allons ouvrir ce modèle » et un checkpoint téléchargeable avec une vraie licence a déjà été de cinq jours une fois cette année ; rien ne dit qu'il se referme vite.
- Surveillez sur quel échelon d'ouverture il atterrit. Rien dans « ouvert » n'est une chose unique — la licence à seuil de Llama, l'Apache 2.0 de Glimmer, ou quelque chose entre les deux sont trois engagements très différents portant le même mot.
- Glimmer reste l'histoire la plus durable, quoi qu'il arrive à Spark 1.2. Un vrai modèle local-agent en Apache 2.0 avec des chiffres compétitifs face à Gemma4 et Qwen3.6 change ce qui tourne aujourd'hui sur un GPU grand public. Une promesse sur une sortie future ne change rien tant qu'elle n'est pas livrée.
Références : Meta AI Research — Introducing Muse Glimmer · Fiche modèle Muse-Glimmer-30B — Hugging Face · CNBC — Meta launches Muse Glimmer open-weight AI model · Phoronix — Meta Publishes Muse Glimmer as 30B Open Agentic Model · couverture liée : Muse Code, le pari de Meta sur des agents qui n'oublient rien · La semaine où Washington a flirté avec l'interdiction des poids ouverts · Ouvert jusqu'où ? Petit guide des licences de modèles d'IA · Le basculement des poids lourds