Tencent a publié et rendu open source Hy4 preview — un modèle Mixture-of-Experts de 770 milliards de paramètres, 49 milliards actifs (78 couches : une couche dense plus 77 couches MoE avec 256 experts routés et 1 expert partagé, 8 experts routés activés par token en plus de l'expert partagé) avec une fenêtre de contexte de 1M de tokens, publié sous licence Apache 2.0. Il est disponible sur Hugging Face, GitHub, ModelScope, AtomGit, Tencent Cloud, et OpenRouter, et gratuit pendant deux semaines au lancement via les produits WorkBuddy et CodeBuddy de Tencent.
Le bond d'une génération à l'autre est réel et important
Le propre tableau comparatif de Tencent (lu ici directement plutôt que le sous-ensemble mis en avant dans les graphiques en barres) montre que l'écart entre Hy4 preview et son propre prédécesseur, Hy3 preview, est véritablement substantiel sur presque chaque benchmark listé : DeepSWE 28,0 → 64,3 ; ProgramBench 3,0 → 17,5 ; MathArena Apex 2025 38,7 → 74,2 ; BrokenArXiv 26,7 → 54,6 ; SWE-Marathon 5,0 → 31,9. Tencent qualifie cela de « plus grand gain d'une génération à l'autre que nous ayons mesuré », et sur les chiffres publiés, cette affirmation précise tient.
Compter le tableau complet change le cadrage de « frontière open source »
L'annonce de Tencent déclare que cela place Hy4 preview « à la frontière open source », et met en avant 12 benchmarks sous forme de graphiques en barres le comparant à Hy3, Qwen 3.8 Max, DeepSeek V4 Pro, GPT 5.6 Sol, GLM 5.3, Kimi K3, et Claude Opus 5. Il vaut la peine de compter directement plutôt que de prendre le cadrage du graphique au pied de la lettre : sur les environ 43 lignes comparables du tableau complet de Tencent (couvrant les catégories codage agentique, recherche agentique, agent de travail, STEM, et raisonnement), Hy4 preview n'obtient le score le plus élevé que sur une seule ligne — SWE Atlas Codebase Q&A, à 64,0. Parmi les 12 benchmarks précis que Tencent a choisi de représenter en graphique, Hy4 preview ne détient le score le plus élevé sur aucun d'entre eux selon les chiffres de ce même tableau : GPT 5.6 Sol ou Claude Opus 5 mène la plupart d'entre eux (ProgramBench, SWE Atlas Refactoring, Agents' Last Exam, APEX-Agents, OneMillionBench, Humanity's Last Exam, HorizonMath), et d'autres modèles à poids ouverts en prennent plusieurs autres (GLM 5.3 et Kimi K3 devancent tous deux légèrement sur Terminal-Bench 2.1 et DeepSWE). Cela ne signifie pas que Hy4 preview n'est pas compétitif — il est fréquemment proche derrière le leader, et clairement devant Hy3 sur l'ensemble — mais « frontière open source » se lit plus précisément comme « proche de la frontière de ce que les modèles ouverts peuvent faire » que comme « mène le peloton », une fois le tableau compté ligne par ligne plutôt que lu à travers les graphiques sélectionnés.
Un détail méthodologique qui mérite d'être crédité
Les propres notes de bas de page de Tencent divulguent que les scores marqués d'un astérisque dans son tableau comparatif proviennent des propres tests de Tencent sur les autres modèles, pas nécessairement des chiffres rapportés par ces fournisseurs eux-mêmes — une distinction précise et vérifiable entre chiffres auto-rapportés et chiffres reproduits de façon indépendante, facile à brouiller dans un tableau comparatif et qui mérite d'être nommée directement puisque Tencent la divulgue plutôt que de la laisser ambiguë.
L'évaluation humaine à l'aveugle montre une avance étroite, pas dominante
Tencent a mené une évaluation à l'aveugle en côte à côte : 163 experts internes ont noté les sorties de modèles sur 203 tâches d'ingénierie réelles. Hy4 preview a obtenu une moyenne de 2,99 contre 2,92 pour GLM 5.3 (46,8 % de victoires, 12,8 % d'égalités, 40,4 % de défaites) et 2,94 pour Kimi K3 (51,2 % de victoires, 7,9 % d'égalités, 40,9 % de défaites). Il vaut la peine de lire ces répartitions victoires/défaites directement : un écart de 46,8 % contre 40,4 % est une vraie avance, pas une erreur d'arrondi, mais c'est aussi une répartition presque égale avec des défaites significatives dans les deux sens — une image plus honnête de « légèrement en tête » que de « gagne ».
Une étude de cas de recherche auto-rapportée, non vérifiée de façon indépendante
Tencent décrit Hy4 preview gérant plusieurs sessions Codex en parallèle lors d'une tâche de recherche post-entraînement, agissant comme le « chercheur » coordinateur dirigeant l'exploration de Codex, et battant Codex travaillant seul sur les 8 cibles d'évaluation de cet exercice. C'est une propre étude de cas interne de Tencent relayée dans l'annonce, pas un résultat reproduit de façon indépendante — à traiter comme illustratif d'une capacité visée plutôt que comme une affirmation vérifiée en externe.
Ce que Tencent divulgue comme problèmes connus
L'annonce déclare directement que Hy4 preview passe actuellement « plus de temps que nécessaire à raisonner sur des tâches complexes » et a « une tendance à sur-vérifier son propre travail », et présente explicitement la publication comme une version précoce livrée pour recueillir des retours, suivant la même approche que celle utilisée pour Hy3 preview.
Tarification
Tarification API de Tencent par million de tokens : 0,042 $ en entrée mise en cache, 0,834 $ en entrée, 2,501 $ en sortie.
Références : Tencent — Introducing Hy4 preview, lu directement dans son intégralité, y compris le tableau complet de benchmarks · Hy4 preview sur Hugging Face · l'annonce de Tencent Hunyuan sur X · détails d'architecture et de licence relayés à partir de résumés WebSearch de la couverture de Pandaily et BigGo Finance — cet environnement n'a pas pu récupérer ces articles de façon indépendante (restrictions d'accès) · couverture liée : Frontier Arcade : tendances et prédictions