2026-10-09

Microsoft lance Microsoft-Decision-1, un modèle de décision basé sur Qwen3.5-9B qui mène la précision moyenne sur 36 benchmarks avec une latence médiane de 85 ms

AIModels🌍 North America

Microsoft a lancé Microsoft-Decision-1 le 9 octobre 2026, un modèle de prise de décision rapide disponible dans Microsoft Foundry et via OpenRouter. Il est post-entraîné à partir de Qwen3.5-9B et renvoie en une seule passe une probabilité calibrée pour chaque option de réponse, pour des questions oui/non, à choix multiples et de notation, ainsi que pour l'évaluation par grille des réponses d'IA et des actions d'agents. Microsoft le destine au routage, à la classification, à la priorisation, à la vérification et au contrôle de flux de travail, et revendique la meilleure précision dans sa comparaison de 36 benchmarks et 147 137 questions, avec la réponse mesurée la plus rapide : une médiane (p50) de 85 ms, soit environ 35 fois plus vite que GPT-6 Sol. Le fil d'annonce de Satya Nadella indique que Microsoft le teste déjà « de la réponse aux incidents et du contrôle qualité à la découverte scientifique ».

Ce que fait un modèle de décision

Là où un LLM génère du texte ou raisonne longuement, un modèle de décision produit une sortie structurée que le logiciel peut exploiter immédiatement, à très faible coût. Microsoft-Decision-1 prend un ensemble fixe d'options et note chacune d'elles par un simple appel d'API structuré. Il sera bientôt rebasé sur d'autres modèles, dont des modèles Microsoft AI (MAI) et OpenAI. Ce blog a couvert un lancement similaire avec les modèles d1 ouverts de Liquid AI deux jours plus tôt.

Microsoft articule la conception autour de cinq défis :

  • Vitesse. Ajouter 100 ms à chacune de 20 décisions séquentielles ajoute deux secondes.
  • Généralisation. L'évaluation couvre des benchmarks tenus à l'écart de l'entraînement : routage, classement, contexte long, multilingue, hors distribution, raisonnement et sécurité. Microsoft a aussi pris plusieurs des meilleurs modèles publics du classement JevBench et les a exécutés sur 36 benchmarks supplémentaires, publics et privés.
  • Robustesse. Perturber de huit façons la même requête inverse la décision dans 1,3 % des perturbations en moyenne, et dans aucune lorsque les descriptions des options sont reformulées ou que les options sont inversées ou mélangées.
  • Calibration. Les probabilités font partie de l'API : une prédiction à 90 % doit donc être juste environ 9 fois sur 10.
  • Sécurité. Sur 5 250 requêtes réparties dans 11 benchmarks couvrant les contenus nuisibles, les jailbreaks et les injections de prompt, le modèle a refusé les comportements nuisibles tout en conservant une grande utilité.

Benchmarks

La précision moyenne sur les 36 benchmarks place Microsoft-Decision-1 en tête à 83,5. La calibration (100 signifie que la confiance correspond exactement à la fréquence de réussite du modèle) le place troisième à 92,2.

Graphique en barres de la précision moyenne sur 36 benchmarks : Microsoft-Decision-1 à 83,5, devant Jev 1.13.0 à 82,3 et Quyet-1.0-Large à 81,9. Tiré de l'article de lancement de Microsoft et du fil de Nadella.

Graphique en barres des scores de calibration sur 36 benchmarks : Jev 1.13.0 à 93,7, Quyet-1.0-Large à 93,1, Microsoft-Decision-1 à 92,2. Tiré de l'article de lancement de Microsoft et du fil de Nadella.

ModèlePrécisionCalibrationLatence médiane
Microsoft-Decision-183,592,285 ms
Jev 1.13.082,393,7219 ms
Quyet-1.0-Large81,993,1380 ms
Surogate Rune 26B-A4B79,791,8380 ms
GPT-6 Luna Decisions79,489,9299 ms
deck-31B77,883,5394 ms
H2O-Lightning-4B (v1.1 pour la latence)77,291,8201 ms
Strands-Decider 2B54,8*n/dn/d
GPT-6 Soln/dn/d2,68 s

Strands-Decider 2B (AWS) a été évalué sur 23 des 36 benchmarks, sa moyenne ne porte donc que sur ceux-ci. Les latences sont des médianes ajustées de JevBench, Microsoft-Decision-1 étant mesuré via Foundry dans la même région ; son p95 est de 125 ms.

L'avance en précision est modeste : 1,2 point sur Jev 1.13.0 et 1,6 sur Quyet-1.0-Large, qui occupe la première place de JevBench. Sur la calibration, le modèle est derrière Jev de 1,5 point et derrière Quyet-1.0-Large de 0,9, tout en devançant les quatre autres modèles notés ; chaque modèle présenté se situe à moins de 17 points de la perfection.

La vitesse est l'écart le plus large. Face à Quyet-1.0-Large, le modèle est 4,5 fois plus rapide (380 / 85), et face à H2O-Lightning-4B v1.1, le plus rapide des autres modèles de décision, 2,4 fois (201 / 85). Face à GPT-6 Sol, 2,68 s contre 85 ms font environ 31 fois avec les chiffres arrondis du tableau ; Microsoft avance environ 35 fois.

Chez Microsoft

Les équipes de Microsoft ont elles-mêmes testé le modèle :

  • XBOX Research a classé plus de 10 000 retours ouverts issus d'enquêtes, de Steam et de Twitter/X dans des thèmes fixes. La qualité était comparable à celle de GPT-6 Sol, à plus de 14 fois la vitesse et à un coût 200 fois inférieur.
  • L'équipe Copilot, qui note la qualité des réponses de chat et d'agents, l'a trouvé comparable à GPT-5.6 Luna et 100 fois plus rapide.
  • Réponse aux incidents : pour les ingénieurs d'astreinte, il a récupéré les connaissances mieux et plus vite qu'un LLM.
  • Microsoft Discovery : les scores étaient 46 fois plus cohérents qu'un score basé sur un LLM, à trois fois la vitesse, et la replanification adaptative s'exécutait près de quatre fois plus vite.

Deux démos illustrent le même point : une classification exécutée face à GPT-6 Sol, et un agent d'utilisation d'ordinateur qui achète un sac à dos plus vite qu'un agent piloté par GPT-6 Sol.

Où l'utiliser

La liste de cas d'usage de Microsoft comprend :

  • les contrôles d'agents (continuer, arrêter, réessayer, passer la main)
  • le routage de modèles
  • le jugement par IA et l'étiquetage de données
  • le routage de la réponse aux incidents
  • le filtrage de sûreté et de sécurité
  • l'utilisation d'ordinateur et d'interfaces
  • la robotique
  • la découverte scientifique

Contexte

GPT-6 Sol, la référence de latence ci-dessus, a été lancé le 22 septembre en même temps que Luna ; voir GPT-6 Sol et Luna. Le rebasage prévu sur les modèles MAI fait suite à l'annonce d'intelligence hybride de Windows par Microsoft, qui a amené le modèle de code MAI-Code-1.1 Flash sur le PC.

À lire ensuite