DeepSeek a lancé V4-Pro aujourd'hui, le checkpoint de production (daté 0813) faisant suite à la version préversion citée dans son propre tableau comparatif, aux côtés de mises à jour de V4-Flash ajoutant un effort de raisonnement ajustable. Deux fonctionnalités phares : un effort de raisonnement flexible (bas pour les tâches simples, élevé pour les flux de travail d'agent quotidiens, max pour les tâches complexes) sur V4-Pro et V4-Flash, et un support natif de l'API Responses d'OpenAI, « optimisé pour Codex avec une configuration en un clic ». C'est disponible dès maintenant sur l'app/web sous « Expert Mode » et via l'API, avec des noms de modèles inchangés — les intégrations existantes n'ont rien à modifier pour obtenir le nouveau checkpoint.
Où il se situe réellement
Le propre tableau de DeepSeek compare V4-Pro-0813 et V4-Flash-0731 à leurs versions de préversion respectives ainsi qu'à trois rivaux — GLM-5.2, Kimi-K3, Claude Opus 4.8, et Claude Fable 5 (ce dernier marqué « w/ fallback », un astérisque que DeepSeek n'explique nulle part dans le billet, à noter comme une réserve non expliquée plutôt qu'à passer sous silence). Sur dix benchmarks agentiques et de raisonnement, V4-Pro-0813 mène nettement sur deux — Cybergym (83,3, devançant de justesse les 83,1 de Fable 5) et AutomationBench Public (31,8, devant les 30,8 de Kimi-K3) — et est réellement compétitif sur plusieurs autres, battant Claude Opus 4.8 sur HLE-avec-outils (60,0 contre 57,9) et Terminal Bench 2.1 (87,9 contre 85,0). Mais Fable 5 et Kimi K3 mènent la majeure partie du tableau : DeepSWE (70,0 et 67,5 contre 62,7 pour V4-Pro), Toolathlon-Verified (77,9 et 76,5 contre 74,1), DSBench-FullStack (77,2 et 73,7 contre 71,1), Agents' Last Exam (27,6 pour Kimi-K3 contre 25,7 pour V4-Pro). C'est un modèle qui a comblé l'essentiel de la distance vers la frontière, pas un qui la revendique.
Le bond générationnel est le titre le plus honnête
La comparaison la plus intéressante dans le propre tableau de DeepSeek est V4-Pro-0813 face à sa propre version de préversion, et elle est spectaculaire : DeepSWE 12,8 → 62,7, presque 5x. Terminal Bench 2.1 72,1 → 87,9. Cybergym 52,7 → 83,3. AutomationBench 12,8 → 31,8, deux fois et demie. C'est la même forme que nous avons désormais vue chez Grok 4.6 face à 4.5 et le bond de déploiement local de Ling-3.0-tiny ce mois-ci — l'écart préversion-vers-lancement sur les benchmarks agentiques est systématiquement plus grand que l'écart lancement-vers-rival, à travers les laboratoires. Quoi qu'il se passe dans le dernier kilomètre du post-entraînement entre « préversion » et « livré » fait plus de travail en ce moment que la génération de modèle de base.
Une note méthodologique mérite d'être signalée : les chiffres des agents de code ont été mesurés avec « notre futur DeepSeek Harness (mode minimal) » — un harnais que DeepSeek décrit comme encore à venir, utilisé pour générer des chiffres de comparaison officiels avant d'être lui-même publié. Ce « DeepSeek Harness » était déjà mentionné comme à venir lors du lancement de V4-Flash en juillet ; il est toujours « à venir » un mois plus tard, ce qui signifie soit qu'il est proche, soit que « à venir » fait un peu de travail marketing de son côté.
La vraie histoire est dans le graphique de tarification
L'annonce de tarification séparée de DeepSeek est la partie qui mérite qu'on s'y attarde. La nouvelle tarification API, effective à 16h00 UTC le 16 août, introduit des tarifs de pointe et hors pointe — les heures de pointe étant définies comme 01h00–04h00 et 06h00–10h00 UTC, tout le reste étant hors pointe :
| Modèle | Sortie hors pointe | Sortie en pointe |
|---|---|---|
| DeepSeek-V4-Flash | 0,66 $ | 1,32 $ |
| DeepSeek-V4-Pro | 1,98 $ | 3,96 $ |
En comparant avec le chiffre de 0,87 $ par million de tokens en sortie que ce blog avait consigné pour la tarification de DeepSeek V4 il y a deux semaines : le nouveau tarif hors pointe de V4-Flash est en fait une baisse modeste, à 0,66 $. Son tarif de pointe est une hausse de 52 % par rapport à cet ancien chiffre plat. Et V4-Pro est un tout nouveau palier tarifé séparément qui n'existait pas comme ligne distincte auparavant — jusqu'à 3,96 $ par million de tokens de sortie en heures de pointe, plus de quatre fois et demie l'ancien tarif plat de DeepSeek.
Cela compte au-delà de la propre grille tarifaire de DeepSeek. La tarification de pointe selon l'heure de la journée n'est quelque chose que nous n'avons vu chez aucun autre laboratoire majeur pour son API grand public — OpenAI, Anthropic et Google tarifient tous à plat par token quelle que soit l'heure, parfois avec des paliers de traitement par lots ou prioritaires, jamais avec une courbe de demande horaire. DeepSeek a construit sa réputation comme le laboratoire qui a cassé le plancher des prix ; introduire une tarification aux heures de pointe, même à des tarifs encore bon marché selon les standards de frontière, c'est DeepSeek empruntant un mécanisme au calcul cloud et au covoiturage plutôt qu'à un autre vendeur de modèles. C'est une réponse rationnelle au même problème que Nemotron 3.5 Lightning et NeMo Switchyard étaient construits pour résoudre — la demande n'est pas plate, et une tarification plate sous une demande variable signifie soit du surprovisionnement, soit un service dégradé aux heures de pointe — mais c'est une première structurelle pour ce segment du marché, à surveiller pour voir si elle se propage.
La fiche du modèle confirme les poids, la licence, et un vrai point de friction
La fiche complète du modèle est désormais lisible, et elle referme la plupart de ce que cet article signalait comme non confirmé. Licence : MIT — le choix le moins contraignant disponible, plus permissif que les licences à seuil de revenus que la couverture de ce mois-ci a suivies chez d'autres laboratoires. La fiche nomme aussi directement le changement architectural derrière la sortie « 0813 » : V4-Pro-0813 est « construit sur la structure du modèle DeepSeek-V4-Pro (Preview), avec un module de décodage spéculatif DSpark attaché » — le même modèle de base, plus un composant d'accélération à l'inférence. La fiche ne prétend pas que DSpark explique à lui seul le bond spectaculaire des benchmarks entre la préversion et le lancement mis en avant plus haut, mais c'est un contributeur partiel plausible qui mérite d'être nommé : le propre cadrage de DeepSeek est que les améliorations sont « particulièrement prononcées en environnement de production », et le décodage spéculatif achète plus de raisonnement utilisable dans le même budget de temps réel, précisément sur les tâches agentiques à long horizon où les plus gros bonds sont apparus.
Un vrai point de friction, qui mérite d'être signalé plutôt que passé sous silence : cette sortie n'inclut pas de gabarit de conversation Jinja standard. Au lieu du fichier chat_template.jinja que presque toutes les fiches de modèle Hugging Face incluent, DeepSeek fournit un module d'encodage Python dédié avec des fonctions personnalisées pour sérialiser les messages dans le format d'entrée du modèle et analyser sa sortie — une chaîne d'outils sur mesure plutôt que celle, standard, de l'écosystème. C'est une vraie taxe, quoique mineure, sur le « ouvert veut dire que n'importe qui peut simplement le charger » : vLLM et SGLang bénéficient tous deux d'un support de premier ordre avec des indicateurs de lancement spécifiques pour DSpark (--speculative-config avec method: dspark sur vLLM ; --speculative-algorithm DSPARK sur SGLang, les poids cible et brouillon partageant le même checkpoint), donc les principaux frameworks de service sont couverts — mais un amateur qui tend la main vers le workflow habituel AutoTokenizer.apply_chat_template() se heurtera à un mur que cette sortie spécifique ne lisse pas.
Réglages locaux recommandés : température 1,0, top_p 0,95 pour un usage agentique (1,0 sinon), et une longueur de sortie maximale de 384K tokens pour les paliers d'effort de raisonnement élevé et max — un budget réellement large, cohérent avec un modèle construit pour le travail d'agent à long horizon plutôt que pour des réponses rapides.
À surveiller
- Si la tarification de pointe/hors pointe se propage. Si un second laboratoire introduit une tarification API basée sur l'heure dans le prochain trimestre, DeepSeek n'a pas seulement baissé un prix aujourd'hui, il a introduit un mécanisme tarifaire que le reste du marché pourrait adopter.
- Que le DeepSeek Harness sorte réellement. Il est « à venir » depuis au moins juillet tout en générant déjà des chiffres de benchmarks officiels — l'écart entre ces deux états mérite d'être comblé.
- Que l'astérisque « w/ fallback » de Fable 5 soit expliqué, par DeepSeek ou par Anthropic. Une réserve non expliquée sur le modèle avec lequel DeepSeek est le plus directement en concurrence est exactement le genre de détail qui mérite une vérification indépendante de la part de quelqu'un d'autre.
- Si la chaîne d'encodage personnalisée devient un motif permanent chez DeepSeek ou était spécifique à la mise en production rapide de DSpark. Un abandon durable des gabarits Jinja serait un coût faible mais réel pour chaque outil en aval qui suppose leur existence.
Références : DeepSeek (@deepseek_ai) — annonce de lancement de V4-Pro · deepseek-ai/DeepSeek-V4-Pro-0813 sur Hugging Face · couverture liée : La guerre des prix que personne ne mène réellement · Lancement de Grok 4.6 · Les poids ouverts de Qwen3.8-Max atterrissent · Ling-3.0-tiny · Nemotron 3.5 Lightning · Frontier Arcade : tendances et prédictions