GPT-5.6 Luna a chuté de 80 % cette semaine — de 1,00 $/6,00 $ par million de tokens d'entrée/sortie à 0,20 $/1,20 $. Terra baisse de 20 %, à 2 $/12 $. Sol gagne un mode Fast : 2,5× le débit pour 2× le prix — un vrai compromis, pas un cadeau. La même semaine, Artificial Analysis publiait un graphique plaçant Luna au sommet d'une frontière coût-intelligence.
Regardez ce graphique plus longtemps qu'un titre ne l'exige et il dit autre chose que « OpenAI a gagné ». La ligne de frontière reliée passe entièrement par la propre famille de modèles d'OpenAI. Chaque concurrent — GLM-5.2, Gemini 3.6 Flash, Claude Opus 5, Claude Sonnet 5, DeepSeek V4 — figure hors de la ligne comme un point isolé, plusieurs à des scores moindres pour des prix plus élevés. Ce n'est pas nécessairement injuste. C'est aussi précisément le graphique que l'équipe d'OpenAI elle-même dessinerait. Traitez-le comme ce blog traite chaque benchmark auto-noté d'un fournisseur : réel, mais pas neutre.
Ce qui pose la vraie question à laquelle une telle baisse de prix est censée répondre : moins cher que qui, exactement, et pendant combien de temps cela compte-t-il ?
Un marché déjà tarifé n'a pas besoin d'être retarifé
Alignez l'offre actuelle, par million de tokens, et la forme du marché saute aux yeux :
| Modèle | Prix ($/M tokens) | Gamme |
|---|---|---|
| GPT-5.6 Luna | 0,20 out | Rapide, bon marché |
| Gemini 3.5 Flash-Lite | 0,30 out | Rapide, bon marché |
| DeepSeek V4 | 0,87 $ out (rapporté) | Rapide, bon marché |
| GLM-5.2 | 4,40 $ out (rapporté) | Intermédiaire |
| GPT-5.6 Terra | 2,00 out | Intermédiaire |
| Gemini 3.1 Pro | 2,00 out | Intermédiaire |
| Claude Sonnet 5 | 2,00 out | Intermédiaire+ |
| Grok 4.5 | 2,00 out | Intermédiaire |
| Gemini 3.6 Flash | 1,50 out | Intermédiaire |
| GPT-5.6 Sol | 5,00 out | Vaisseau amiral |
| Claude Opus 5 | 5,00 out | Vaisseau amiral |
| Claude Fable 5 | 10,00 out | Frontière |
| Kimi K3 (hébergé) | 15 $/M out | Frontière, poids ouverts |
Le bas de gamme n'est plus un jouet — le nouveau prix de Luna le place dans la même conversation que des modèles qui étaient de niveau vaisseau amiral il y a dix-huit mois. Le mode Fast de Sol n'est pas du tout un nouveau modèle, juste un nouveau réglage sur un ancien — probablement l'aperçu le plus honnête de la suite : pas de nouvelles gammes, mais plus de boutons sur les gammes existantes. Et Kimi K3 se situe entièrement hors de ce tableau : dès l'instant où vous auto-hébergez 2,8T de poids ouverts, le « prix par token » cesse d'être le chiffre qui compte et votre propre facture d'infrastructure prend le relais.
Voici l'énigme que ce tableau n'explique pas à lui seul : ces informations sont publiques, comparables et capturables depuis plus d'un an. Si les acheteurs faisaient réellement leurs courses sur ce marché comme le graphique le suppose — en balayant une frontière prix-performance et en routant vers le gagnant de la semaine — le secteur se serait déjà consolidé autour du fournisseur le moins cher à un niveau de qualité donné. Ce n'est pas le cas. Les entreprises qui ont commencé chez un fournisseur y sont, très majoritairement, toujours, remise ou pas, graphique ou pas.
Les acheteurs ne comparent pas, parce que partir coûte plus cher que rester
Une enquête Parallels 2026 auprès de dirigeants d'entreprise rend l'écart explicite : 94 % se disent inquiets du verrouillage fournisseur en IA, et 89 % pensent pouvoir changer de fournisseur en un mois s'ils le voulaient. Parmi ceux qui ont réellement essayé, 58 % disent que cela a échoué ou demandé bien plus d'efforts que prévu. Soixante-quatorze pour cent disent que perdre leur fournisseur actuel perturberait les opérations quotidiennes ou empêcherait l'entreprise de fonctionner.
Ce n'est pas un problème de perception qui se corrige avec le temps — c'est structurel, et c'est largement invisible jusqu'à ce que quelqu'un essaie de partir. Deux modèles exposant un endpoint de chat identique, compatible OpenAI, peuvent diverger sur le format d'appel d'outils, les seuils de refus et la gestion du contexte — un prompt réglé sur les manies d'un modèle se dégrade silencieusement sur un autre, et la panne apparaît en production plutôt qu'en test. Les fine-tunes et les suites d'évaluation sont construits contre le tokenizer et les modes d'échec d'un modèle et ne se transfèrent pas : on les reconstruit, on ne les redéploie pas. Les paliers tarifaires d'entreprise portent souvent des engagements annuels de 10 000 à 50 000 $ — changer, c'est renoncer à de l'argent déjà dépensé. Et l'équipe qui profiterait d'un modèle moins cher est rarement celle qui possède l'intégration et devrait refaire le travail.
Mettez tout cela ensemble et une baisse de prix répond à une question que presque personne ne pose activement. L'acheteur qui bénéficierait du nouveau prix de Luna ne mène pas de comparaison en direct contre Gemini Flash-Lite ; il ne mène aucune comparaison, parce que le coût de la découverte n'est pas la facture d'API — c'est la reconstruction.
Ce qui fait vraiment bouger quelqu'un
Si le prix déclenche rarement un changement, autre chose doit le faire — et le motif, sur les cas réels, est que c'est involontaire. La couche de routage d'OpenRouter existe en grande partie parce que les fournisseurs déprécient des modèles sous les pieds de leurs clients : plus de 70 retirés ou restreints chez les grands fournisseurs ces dernières années, chacun forçant une migration sur le calendrier du fournisseur, pas du client. Les pannes font plus de dégâts à la fidélité que les tarifs n'en feront jamais — l'infrastructure de routage déprioritise par défaut tout fournisseur avec un incident récent, parce qu'une démo lente devant un client coûte plus que ce qu'un bon tarif a jamais fait économiser. Et personne ne réarchitecture un pipeline de production parce qu'un benchmark a grimpé de deux points ; on le fait quand une tâche que l'ancien modèle ne savait tout simplement pas faire — contexte long, audio natif, un vrai saut qualitatif — devient possible et cesse d'être défendable à ignorer.
La version la plus nette d'un changement involontaire a déjà eu lieu cette année, pas en hypothèse. Claude Fable 5 a été entièrement retiré de la disponibilité par directive américaine de contrôle des exportations le 12 juin, rétabli dix-neuf jours plus tard. Personne exploitant Fable 5 en production n'a reçu de tableau comparatif ni de délai de grâce. Ils ont reçu un vendredi.
Lu ainsi, la baisse de prix de GPT-5.6 cesse de ressembler à une offre d'ouverture dans une négociation que personne ne mène. C'est une assurance contre le seul scénario où la négociation a bel et bien lieu — le jour rare où un client est forcé de regarder, par une panne, un avis de dépréciation ou un écart de capacité devenu trop cher à contourner. Ce jour-là, être l'option raisonnable la moins chère vaut plus que ce qu'être l'option la moins chère valait chacun des 364 jours précédents.
Mais l'API n'est que l'un des trois endroits d'où l'on peut « quitter un fournisseur » — et c'est celui où la question compte le moins.
Un étage au-dessus : là où changer est une fonctionnalité, pas un échec
Au niveau brut de l'API, changer est effectivement presque trivial — endpoints compatibles, une chaîne de caractères dans un routeur. Tout ce qui précède sur la viscosité des entreprises est du coût organisationnel enroulé autour d'une opération techniquement simple. Un étage au-dessus, dans les outils où les développeurs travaillent vraiment, même ce cadrage se dissout : un développeur dans Cursor ne migre pas entre fournisseurs du tout. Le modèle est un menu déroulant. En changer n'est pas un projet ; c'est une préférence, parfois réglée tâche par tâche — ce modèle pour les refactorisations, cet autre pour les tests.
Les harnais comme Cursor existent précisément pour rendre le modèle fongible : mêmes raccourcis, même moteur de contexte, même flux de travail, n'importe quel cerveau. À cette couche, le coût de migration a été ramené à zéro à dessein — et la fidélité ne s'attache pas au modèle, car rien ne s'accumule dans le modèle. Tout s'accumule dans l'outil : réflexes, contexte de projet, configuration, confiance. Demandez à un utilisateur de Cursor de lâcher Claude une semaine : il haussera les épaules. Demandez-lui de lâcher Cursor : vous retrouvez l'histoire des 58 % — le verrou n'a pas disparu, il a déménagé dans le harnais.
Les laboratoires l'ont compris, et c'est pourquoi chacun expédie désormais son propre harnais — Claude Code, Codex, Gemini CLI. Quand l'API est une commodité et le modèle un menu déroulant, le seul endroit où reconstruire de l'attachement est l'outil lui-même. Claude Code n'est pas une fonctionnalité annexe ; c'est la réponse structurelle au fait que Cursor a rendu les modèles interchangeables — re-lier le modèle au flux de travail, pour que quitter le modèle signifie à nouveau quitter quelque chose qui manquerait.
Et un étage en dessous : l'appli, où personne ne compare rien
Puis il y a la personne pour qui tout cela existe en fin de compte — pas le développeur : l'abonné ordinaire, une appli de chat sur le téléphone et 20 € par mois qui partent du compte. Il ne verra jamais le tableau de prix ci-dessus, ne lancera jamais une éval, n'entendra jamais parler de la baisse de cette semaine. Sa version de la question n'est pas « Luna est-il moins cher au token ». C'est « est-ce que je quitterais cette appli ? » — et presque rien de graduel ne l'y poussera jamais.
Ce qui le retient n'est pas la position du modèle dans un benchmark ; c'est ce que l'appli a accumulé autour de lui. Des mois d'historique. La mémoire — l'assistant qui connaît déjà votre métier, vos projets, le prénom de vos enfants et vos tics d'écriture est le seul à détenir un actif qui grandit, et il n'existe nulle part de bouton d'import : vous pouvez exporter votre historique, aucun rival ne l'ingérera dans sa propre mémoire. L'abonnement est déjà payé, et il coûte les mêmes vingt partout — ce qui n'est pas un accident. Aucun laboratoire ne veut que la décision du grand public porte sur le prix, car sur le prix ils sont identiques ; la vraie compétition porte sur qui détient votre contexte.
Ce qui fait vraiment bouger un abonné, c'est l'histoire des entreprises traduite en termes grand public : pas la comparaison — les événements. Un moment de capacité devenu viral et visiblement absent de son appli — un style d'image que tout le monde poste, une fonction de recherche que tout le monde partage. Un produit qui n'existe que de l'autre côté — c'est ainsi que Claude Code a discrètement fait passer une génération de développeurs dans l'écosystème grand public d'Anthropic : l'outil de terminal est arrivé en premier, l'abonnement à l'appli l'a suivi à la maison. Et par-dessus tout, les défauts : Gemini arrive préinstallé dans Android et Workspace, Copilot dans Windows et Office. Pour la plupart des gens, le meilleur modèle est celui qui est déjà sur l'écran d'accueil, et la distribution bat les benchmarks avec une marge qu'aucune baisse de prix ne touchera jamais.
Trois marchés sous un seul nom
« Quitter un fournisseur » recouvre donc trois actes dans trois marchés différents. À l'API, changer est techniquement facile et organisationnellement rare — cela arrive involontairement, un vendredi choisi par quelqu'un d'autre. Dans le harnais, changer est si facile que ce n'est plus un événement — le modèle concourt tâche par tâche, et le verrou a émigré dans l'outil. Dans l'appli, changer est le plus rare de tous, et ne bouge que sur des moments, des produits et des défauts — jamais sur des tokens par dollar.
La baisse de prix de cette semaine vit entièrement dans le premier marché. Dans le deuxième, elle change quelle entrée du menu déroulant sera choisie cet après-midi. Dans le troisième, l'abonné n'en entendra jamais parler — et c'est exactement pourquoi les laboratoires qui veulent l'abonné dépensent en mémoire, en placement par défaut et en outils comme Claude Code, plutôt que sur le chiffre du titre.
Liens
- Annonce : OpenAI — Advancing the price-performance frontier with GPT-5.6
- Couverture : VentureBeat — AI price wars · Axios
- Données sur les coûts de migration : Enquête Parallels 2026 sur le verrouillage fournisseur
- Mécanique de routage : OpenRouter — how model routing works
- Lié : la suspension forcée de 19 jours de Claude Fable 5 · l'historique des prix sur 234 sorties dans l'arcade