2026-09-03

Muse Spark 1.3 domine le contexte long et le code, mais reste à zéro sur les tâches d'agent — sauf sur le graphique que Meta n'a pas publié

AIInfrastructure🌍 North America

Meta a lancé Muse Spark 1.3 aujourd'hui, déployé dans Muse Code et l'API Meta Model. Le prix reste inchangé par rapport à 1.2 : 1,25 $ par million de tokens en entrée et 4,25 $ par million en sortie sur le palier standard, 0,10 $/0,20 $ sur le palier Contributeur pour les développeurs qui acceptent que Meta entraîne ses modèles sur leurs prompts.

Le tableau de bord révèle une séparation frappante

Meta a publié un tableau comparatif sur 11 benchmarks face à Muse Spark 1.2, GPT-5.6 Sol (max) et Claude Opus 5 (max), répartis en trois catégories : Agent, Contexte long et Code. La séparation entre ces catégories est frappante.

Sur les deux lignes de Contexte long, Muse Spark 1.3 l'emporte nettement : MRCR 256K–512K (98,5 contre 91,5 pour GPT-5.6 Sol ; Opus 5 n'est pas renseigné) et MRCR 512K–1M (98,1 contre 73,8). Sur le Code, il remporte deux lignes sur trois : DeepSWE v1.1, codage agentique à long horizon (75,4, devançant de peu les 74,0 d'Opus 5), et SWEAtlas CodeBase QnA (59,4 contre 52,7 pour Opus 5) — et fait match nul avec GPT-5.6 Sol en tête sur la troisième, Terminal-Bench 2.1 (tous deux à 88,8, devant les 86,7 d'Opus 5).

Sur les six benchmarks de la catégorie Agent, il n'en remporte aucun. Claude Opus 5 s'impose sur l'Elo de travail de connaissance GDPval-AA v2 (1824 contre 1754 pour 1.3), JobBench, usage professionnel des outils (65,7 contre 64,9), OSWorld 2.0, usage agentique d'un ordinateur (68,3 contre 66,9), et AutomationBench, flux de travail d'entreprise de bout en bout (50,3 contre 49,4). GPT-5.6 Sol s'impose sur DeepSearchQA, navigation agentique (93,0 contre 89,4) et sur l'Agentic IF Index interne de Meta pour le suivi d'instructions (60,5 contre 57,8). Muse Spark 1.3 dépasse largement son propre prédécesseur partout, mais face aux deux rivaux de pointe, la ligne catégorielle tient : dominant sur le contexte et le code, à zéro sur l'exécution de tâches agentiques.

C'est une correction utile au cadrage de Meta elle-même. Le blog de recherche parle d'un pas vers la « superintelligence personnelle » ; le tweet de lancement de Mark Zuckerberg lui-même va plus loin, qualifiant cela de « plus grand bond que nous ayons fait jusqu'ici sur le code et le travail agentique ». Le tableau de benchmarks joint à ce même tweet montre pourtant zéro victoire nette sur l'ensemble des six lignes de la catégorie Agent. Sur les chiffres que Meta a elle-même choisi de publier, il s'agit d'un modèle qui lit et écrit du code sur d'immenses fenêtres de contexte mieux qu'Opus 5 ou GPT-5.6 Sol — pas d'un modèle qui les surpasse en tant qu'agent, quoi qu'en dise le tweet.

Sauf sur le composite que Meta n'a pas publié

L'Intelligence Index v4.1.1 d'Artificial Analysis — un indice indépendant mêlant neuf évaluations couvrant le travail de connaissance, des tâches d'agent bancaire, le codage en terminal, le codage scientifique et le raisonnement expert, entre autres — raconte une histoire moins nette. Muse Spark 1.3 (max) obtient 62 sur cet indice, à égalité pour la troisième place globale derrière seulement Claude Fable 5.1 (66) et Claude Opus 5 (63), et devant GPT-5.6 Sol, Grok 4.6 (tous deux à 61), et tous les autres modèles du classement, y compris Gemini 3.8 Flash (59). Muse Spark 1.3 (xhigh) obtient 61, dans le même groupe de tête. C'est une performance réellement solide sur un composite que Meta n'a ni choisi ni publié lui-même — et cela s'accorde mal avec « à zéro sur les tâches d'agent », puisque trois des neuf composantes de l'indice sont elles-mêmes de nature agentique (τ³-Banking, Terminal-Bench v2.1, AA-LCR).

La réserve est réelle, cependant : les deux barres de Muse Spark 1.3 sont marquées « non actuellement disponible » sur le propre graphique d'Artificial Analysis — un motif à damier que le site utilise pour les scores qu'il n'a pas encore testés lui-même de manière indépendante. Quelle que soit l'origine de ces chiffres, ils ne constituent pas encore un résultat vérifié par Artificial Analysis. À traiter comme provisoire pour l'instant, et non comme une infirmation du constat d'exclusion sur les benchmarks d'agent ci-dessus.

Ce qui change réellement pour les utilisateurs

Meta cadre les gains qualitatifs autour de la collaboration plutôt que de la capacité brute. Muse Spark 1.3 pose des questions de clarification quand un prompt est ambigu, demande de l'aide quand il est bloqué, et confirme avant d'entreprendre des actions qu'il juge conséquentes — avec un réglage explicite pour choisir s'il rend compte fréquemment de sa progression ou travaille en silence jusqu'à produire un livrable. Il est aussi entraîné à faire correspondre les messages entrants à la bonne tâche au sein d'un même fil désordonné et multi-tours, qu'un nouveau message vienne réorienter une requête en cours ou l'interrompre franchement. Face à Muse Spark 1.2, les propres comparaisons d'ingénierie de Meta chiffrent le gain d'efficacité à environ 20 % d'appels d'outils en moins et 25 % de tokens en moins pour un travail de code comparable.

La promesse des poids ouverts reste une promesse

Cinq jours après la sortie fermée de Muse Spark 1.2, Meta avait annoncé vouloir ouvrir les poids — sans licence, sans date. C'était le 10 août. Trois semaines plus tard, Muse Spark 1.3 sort lui aussi fermé, et le blog de recherche de Meta comme le tweet de Zuckerberg répètent la même phrase — celle du blog dit « nous avons aussi de plus gros modèles, les poids ouverts de Muse Spark, et plus encore en préparation » ; celle de Zuckerberg est plus courte : « les sorties en poids ouverts de Muse Spark arrivent bientôt ». Toujours pas de date, toujours pas de licence, répété par le PDG lui-même, sur la deuxième génération de modèle depuis que ce revirement a été promis pour la première fois.

Sécurité

Meta indique que Muse Spark 1.3 présente une robustesse adversariale renforcée face à l'injection de prompt et une meilleure calibration sur ce qui constitue une action irréversible lors des exécutions agentiques longues. Le mode de raisonnement maximal n'accompagne pas cette sortie — Meta indique qu'il arrivera « prochainement », une fois des tests de sécurité supplémentaires terminés, laissant le palier de capacité le plus élevé annoncé du modèle indisponible au lancement.

À surveiller

  • Si Artificial Analysis vérifie effectivement les scores de 62/61. Tant que le marqueur « non actuellement disponible » ne disparaît pas, la preuve la plus solide contre l'exclusion sur les benchmarks d'agent reste non confirmée par la seule partie qui n'a pas choisi elle-même les chiffres à afficher.
  • Si l'écart sur la catégorie Agent se referme avec la 1.4. Un modèle qui domine le contexte long et le code mais perd sur tous les benchmarks de la catégorie Agent de Meta ressemble à un laboratoire ayant optimisé un seul axe ce cycle-ci — à vérifier si la prochaine sortie rééquilibre vers l'exécution de tâches agentiques.
  • Une date réelle pour les poids ouverts de Muse Spark. « Pour bientôt » est la réponse depuis trois semaines et deux générations de modèle ; le prochain signal réel sera une licence et une date, pas une nouvelle répétition de la même phrase.
  • La sortie effective du mode de raisonnement maximal. « Prochainement, après des tests de sécurité supplémentaires » reste ouvert — à vérifier combien de temps s'écoule entre le lancement d'aujourd'hui et l'arrivée effective de la capacité promise.