2026-07-30

La guerre des prix que personne ne mène vraiment

AIInfrastructure🌍 Global

Le prix de GPT-5.6 Luna a chuté de 80 % cette semaine : de 1,00 et 6,00 $ le million de tokens en entrée et en sortie à 0,20 et 1,20 $. Terra baisse de 20 %, à 2 et 12 $. Sol gagne un mode Fast : 2,5 fois le débit pour deux fois le prix, soit un véritable arbitrage et non un cadeau. La même semaine, Artificial Analysis publiait un graphique plaçant Luna au sommet d'une frontière coût-intelligence.

Regardez ce graphique un peu plus longtemps que ne l'exige un titre, et il raconte autre chose que « OpenAI a gagné ». La frontière ne relie que des modèles maison. Tous les concurrents — GLM-5.2, Gemini 3.6 Flash, Claude Opus 5, Claude Sonnet 5, DeepSeek V4 — apparaissent en dehors de la ligne, sous forme de points isolés, plusieurs à des scores inférieurs pour des prix supérieurs. Ce n'est pas forcément malhonnête. C'est aussi exactement le graphique que l'équipe d'OpenAI dessinerait. À traiter comme ce blog traite tout benchmark auto-évalué : réel, mais pas neutre.

Reste la vraie question à laquelle une telle baisse est censée répondre : moins cher que qui, exactement, et pendant combien de temps cela compte-t-il ?

Un marché déjà tarifé n'a pas besoin d'être retarifé

Alignez l'offre actuelle, ramenée au million de tokens, et la structure du marché saute aux yeux :

ModèlePrix ($ le million de tokens)Segment
GPT-5.6 Luna0,20 $ entrée / 1,20 $ sortieRapide, bon marché
Gemini 3.5 Flash-Lite0,30 $ entrée / 2,50 $ sortieRapide, bon marché
DeepSeek V40,87 $ en sortie (annoncé)Rapide, bon marché
GLM-5.24,40 $ en sortie (annoncé)Intermédiaire
GPT-5.6 Terra2,00 $ entrée / 12,00 $ sortieIntermédiaire
Gemini 3.1 Pro2,00 $ entrée / 12,00 $ sortieIntermédiaire
Claude Sonnet 52,00 $ entrée / 10,00 $ sortieIntermédiaire+
Grok 4.52,00 $ entrée / 6,00 $ sortieIntermédiaire
Gemini 3.6 Flash1,50 $ entrée / 7,50 $ sortieIntermédiaire
GPT-5.6 Sol5,00 $ entrée / 30,00 $ sortiePhare
Claude Opus 55,00 $ entrée / 25,00 $ sortiePhare
Claude Fable 510,00 $ entrée / 50,00 $ sortieHaut du panier
Kimi K3 (hébergé)15 $ en sortieHaut du panier, poids ouverts

L'entrée de gamme n'a plus rien d'un jouet : le nouveau tarif de Luna le place dans la même catégorie que des modèles phares d'il y a dix-huit mois. Le mode Fast de Sol n'est pas un nouveau modèle, mais un nouveau réglage sur un ancien — sans doute le meilleur aperçu de ce qui vient : non pas de nouveaux segments, mais davantage de boutons sur les segments existants. Quant à Kimi K3, il échappe entièrement à ce tableau : dès lors que vous hébergez vous-même 2 800 milliards de paramètres ouverts, le « prix au token » cesse d'être le chiffre pertinent et c'est votre propre facture d'infrastructure qui prend le relais.

Voici l'énigme que ce tableau ne résout pas à lui seul : ces informations sont publiques, comparables et faciles à collecter depuis plus d'un an. Si les acheteurs faisaient réellement leur marché comme le graphique le suppose — en parcourant une frontière prix-performance et en basculant vers le gagnant de la semaine —, le secteur se serait déjà consolidé autour du fournisseur le moins cher à qualité donnée. Ce n'est pas le cas. Les entreprises qui ont commencé chez un fournisseur y sont, dans leur immense majorité, toujours — remise ou pas, graphique ou pas.

Les acheteurs ne comparent pas, parce que partir coûte plus cher que rester

Une enquête Parallels de 2026 auprès de dirigeants d'entreprise rend l'écart flagrant : 94 % s'inquiètent de la dépendance à un fournisseur d'IA, et 89 % estiment pouvoir en changer en un mois s'ils le décidaient. Parmi ceux qui s'y sont réellement essayés, 58 % rapportent un échec ou un effort très supérieur aux prévisions. Et 74 % jugent que perdre leur fournisseur actuel perturberait le travail quotidien, voire paralyserait l'entreprise.

Ce n'est pas un problème de perception que le temps corrigerait : c'est structurel, et cela reste largement invisible jusqu'au jour où quelqu'un tente de partir. Deux modèles exposant une interface de conversation identique, compatible OpenAI, peuvent diverger sur le format d'appel des outils, les seuils de refus et la gestion du contexte. Une consigne réglée sur les manies de l'un se dégrade silencieusement chez l'autre, et la panne se manifeste en production plutôt qu'en test. Les modèles affinés et les batteries d'évaluation sont construits autour du tokenizer et des défauts d'un modèle précis : ils ne se transposent pas, il faut les refaire. Les paliers tarifaires d'entreprise s'accompagnent souvent d'engagements annuels de 10 000 à 50 000 $, et changer revient à renoncer à de l'argent déjà engagé. Enfin, l'équipe qui profiterait d'un modèle moins cher est rarement celle qui détient l'intégration et devrait refaire le travail.

Mis bout à bout, tout cela signifie qu'une baisse de prix répond à une question que presque personne ne se pose. L'acheteur qui profiterait du nouveau tarif de Luna ne compare pas activement avec Gemini Flash-Lite ; il ne compare rien du tout, parce que le coût de l'exercice n'est pas la facture d'API, c'est la reconstruction.

Ce qui fait vraiment bouger quelqu'un

Si le prix déclenche rarement un changement, c'est qu'autre chose s'en charge — et, dans les cas réels, ce changement est presque toujours subi. La couche de routage d'OpenRouter existe en grande partie parce que les fournisseurs retirent des modèles sous les pieds de leurs clients : plus de 70 modèles supprimés ou restreints chez les grands fournisseurs ces dernières années, chacun imposant une migration au calendrier du fournisseur, pas du client. Les pannes abîment la fidélité bien plus sûrement que les tarifs ne l'achètent : l'infrastructure de routage relègue par défaut tout fournisseur ayant connu un incident récent, parce qu'une démonstration qui rame devant un client coûte plus cher que ce qu'un bon tarif fera jamais économiser. Et personne ne refond une chaîne de production parce qu'un benchmark a gagné deux points ; on le fait le jour où une tâche que l'ancien modèle ne savait tout simplement pas faire — contexte long, audio natif, un vrai saut qualitatif — devient possible et qu'il n'est plus tenable de l'ignorer.

La version la plus nette de ce changement subi a déjà eu lieu cette année, et pas en théorie. Claude Fable 5 a été entièrement retiré de la disponibilité par directive américaine de contrôle des exportations le 12 juin, rétabli dix-neuf jours plus tard. Aucun de ceux qui exploitaient Fable 5 en production n'a reçu de tableau comparatif ni de préavis. Ils ont reçu un vendredi.

Lue ainsi, la baisse de prix de GPT-5.6 cesse d'être une offre d'ouverture dans une négociation que personne ne mène. C'est une assurance contre le seul scénario où la négociation a bel et bien lieu : le jour, rare, où un client est contraint de regarder ailleurs — une panne, un avis de retrait, un écart de capacité devenu trop coûteux à contourner. Ce jour-là, être l'option raisonnable la moins chère vaut bien davantage que de l'avoir été chacun des 364 jours précédents.

Mais l'API n'est que l'un des trois endroits où l'on peut « quitter un fournisseur », et c'est celui où la question compte le moins.

Un étage au-dessus : changer devient une fonctionnalité, pas un échec

Au niveau brut de l'API, changer est presque trivial : des interfaces compatibles, une chaîne de caractères dans un routeur. Tout ce qui précède sur l'inertie des entreprises n'est que du coût organisationnel enroulé autour d'une opération techniquement simple. Un étage au-dessus, dans les outils où les développeurs travaillent réellement, même cette lecture se dissout : un développeur sous Cursor ne migre pas d'un fournisseur à l'autre. Le modèle est un menu déroulant. En changer n'est pas un projet, c'est une préférence, parfois réglée tâche par tâche — ce modèle-ci pour les refactorisations, celui-là pour les tests.

Les environnements comme Cursor existent précisément pour rendre le modèle interchangeable : mêmes raccourcis, même moteur de contexte, même façon de travailler, et n'importe quel cerveau au bout. À cette couche, le coût du changement a été ramené à zéro à dessein, et l'attachement ne se porte plus sur le modèle, car rien ne s'accumule dans le modèle. Tout s'accumule dans l'outil : réflexes, contexte de projet, configuration, confiance. Demandez à un utilisateur de Cursor de renoncer à Claude une semaine, il haussera les épaules. Demandez-lui de renoncer à Cursor, et vous retrouvez les 58 % : le verrou n'a pas disparu, il a déménagé dans l'outil.

Les laboratoires l'ont compris, et c'est pourquoi chacun propose désormais son propre environnement : Claude Code, Codex, Gemini CLI. Quand l'API se banalise et que le modèle n'est plus qu'un menu déroulant, le seul endroit où reconstruire de l'attachement, c'est l'outil. Claude Code n'est pas une fonctionnalité annexe : c'est la réponse structurelle au fait que Cursor a rendu les modèles interchangeables. Il s'agit de rattacher le modèle à la façon de travailler, pour que le quitter redevienne un renoncement.

Et un étage en dessous : l'appli, où personne ne compare rien

Vient enfin la personne pour qui tout cela existe en définitive. Non pas le développeur, mais l'abonné ordinaire : une application de conversation sur son téléphone et 20 € prélevés chaque mois. Il ne verra jamais le tableau de prix ci-dessus, ne lancera jamais d'évaluation, n'entendra jamais parler de la baisse de cette semaine. Sa question à lui n'est pas « Luna est-il moins cher au token ? », mais « est-ce que je quitterais cette application ? » — et presque rien de graduel ne l'y poussera jamais.

Ce qui le retient n'est pas le classement du modèle dans un benchmark, mais ce que l'application a accumulé autour de lui. Des mois d'historique. La mémoire, surtout : l'assistant qui connaît déjà votre métier, vos projets, le prénom de vos enfants et vos tics d'écriture est le seul à détenir un actif qui grandit, et il n'existe nulle part de bouton d'importation. Vous pouvez exporter votre historique ; aucun concurrent ne l'intégrera à sa propre mémoire. L'abonnement, lui, est déjà payé, et il coûte les mêmes vingt euros partout — ce qui n'a rien d'un hasard. Aucun laboratoire ne souhaite que le grand public tranche sur le prix, puisque sur le prix ils sont identiques ; la vraie concurrence porte sur celui qui détient votre contexte.

Ce qui décide un abonné, c'est la même histoire que chez les entreprises, traduite en termes grand public : non pas la comparaison, mais l'événement. Une prouesse devenue virale et visiblement absente de son application — un style d'image que tout le monde publie, une fonction de recherche que tout le monde partage. Un produit qui n'existe que chez le concurrent : c'est ainsi que Claude Code a fait basculer discrètement une génération de développeurs dans l'écosystème grand public d'Anthropic, l'outil en ligne de commande arrivant d'abord, l'abonnement à l'application suivant à la maison. Et par-dessus tout, les réglages par défaut : Gemini est préinstallé dans Android et Workspace, Copilot dans Windows et Office. Pour la plupart des gens, le meilleur modèle est celui qui se trouve déjà sur l'écran d'accueil, et la distribution bat les benchmarks d'une marge qu'aucune baisse de prix ne rattrapera.

Trois marchés sous un seul nom

« Quitter un fournisseur » recouvre donc trois actes sur trois marchés distincts. Au niveau de l'API, changer est techniquement simple mais organisationnellement rare : cela arrive de façon subie, un vendredi choisi par quelqu'un d'autre. Dans l'outil de programmation, changer est si facile que ce n'est plus un événement : le modèle se remet en jeu à chaque tâche, et le verrou a émigré vers l'outil. Dans l'application grand public, changer est le plus rare de tout, et ne dépend que d'événements, de produits et de réglages par défaut — jamais du nombre de tokens par dollar.

La baisse de prix de cette semaine appartient tout entière au premier marché. Sur le deuxième, elle décide quelle entrée du menu déroulant sera choisie cet après-midi. Sur le troisième, l'abonné n'en entendra jamais parler — et c'est précisément pourquoi les laboratoires qui visent cet abonné investissent dans la mémoire, les réglages par défaut et des outils comme Claude Code, plutôt que dans le chiffre affiché en une.