2026-08-19

2 millions de votes humains plus tard : les sept meilleurs modèles d'image sont tous fermés, et personne n'est vraiment loin devant

AIBenchmarks🌍 Global

Datapoint AI a publié ce qu'elle présente comme le plus grand jeu de données ouvert de préférences humaines pour la génération d'images : plus de 2 millions d'annotations par paires réalisées par de vraies personnes, classant 30 modèles d'image actuels sur 10 catégories d'usage — marketing, design de produit, anime, et d'autres — accompagné d'une subvention de données d'1 million de dollars pour de futurs travaux dans ce domaine. Le jeu de données lui-même est sur Hugging Face. La méthodologie mérite d'être prise au sérieux pour elle-même avant d'en venir à ce que les classements montrent réellement.

La préférence humaine par paires est le bon instrument, et il est plus rare qu'il ne devrait l'être

La plupart des comparaisons de modèles d'image s'appuient encore sur des notateurs esthétiques automatisés ou des métriques de similarité CLIP — des approximations de ce qu'une personne préférerait réellement, pas la préférence elle-même. L'approche de Datapoint se rapproche du modèle du LMSYS Chatbot Arena pour le texte : de vraies personnes regardent deux sorties côte à côte et en choisissent une, agrégées en un score Elo sur suffisamment de comparaisons pour que le bruit s'annule en moyenne. Avec plus de 2 millions d'annotations sur 30 modèles, c'est une taille d'échantillon substantielle pour ce genre d'étude, et la répartition par catégorie (marketing, design de produit, anime, et sept autres) signifie que le classement ne compresse pas chaque cas d'usage en un seul score de « qualité » indifférencié comme le fait tendanciellement un chiffre agrégé unique.

Il vaut aussi la peine de le nommer clairement : Datapoint est une entreprise d'annotation de données — publier le plus grand jeu de données de préférences humaines disponible pour cette tâche est une démonstration directe du pipeline qu'elle vend, pas un exercice académique désintéressé. Cela ne rend pas les données fausses, mais c'est le même genre d'intérêt propre qui mérite d'être noté pour l'affirmation de tout créateur de benchmark sur son propre benchmark, et les lecteurs devraient évaluer la méthodologie sur ses mérites plutôt que sur le seul cadrage « le plus grand au monde ».

Les sept premiers sont tous fermés

En comptant directement le propre tableau Elo de Datapoint : GPT Image 2 (high) mène à 1131, suivi de Seedream 5.0 Pro (1127), Nano Banana 2 (1122), Reve 2.1 (1113), MAI-Image-2.5 (1109), Nano Banana Pro (1106), et GPT Image 1.5 (high) (1103). Chacun de ces sept est un modèle fermé, accessible uniquement par API. Le premier modèle véritablement en poids ouverts de la liste — Hunyuanimage 3.0, de Tencent — se situe au 17e rang (1066), à environ 65 points Elo du leader. FLUX.1 [schnell], la sortie rapide en poids ouverts de Black Forest Labs, est dernier au 30e rang (1000) — bien que ce résultat précis relève moins d'un écart de capacité que d'un compromis attendu : « schnell » est explicitement optimisé pour la vitesse au détriment de la qualité, et finir dernier sur un benchmark de pure préférence est proche de la forme voulue de ce compromis plutôt qu'une surprise.

Cela dit, le motif mérite d'être énoncé clairement plutôt que supposé : sur ce jeu de données précis, à ce moment précis, la préférence humaine pour la qualité générale de génération d'images favorise actuellement les modèles fermés sur toute la ligne, les poids ouverts occupant les paliers intermédiaires et inférieurs plutôt que de rivaliser en tête. C'est une image différente de celle des modèles de langage, où les sorties en poids ouverts ont répété­ment égalé ou battu les modèles fermés de pointe sur des benchmarks individuels ce mois-ci — à surveiller pour savoir si la génération d'images est un paysage concurrentiel authentiquement différent, ou si elle est simplement plus en amont de la même courbe de rattrapage que les modèles de texte ont déjà parcourue.

Tout le champ est plus resserré que ne le suggère « SOTA »

Le second constat est sans doute plus intéressant que l'ordre du classement lui-même : l'ensemble des 30 modèles s'étale de 1131 à 1000 — une bande de 131 points Elo sur tous les modèles testés par Datapoint, du leader reconnu au modèle délibérément rapide et bon marché en bas de tableau. À titre de comparaison, un écart de niveau significatif au classement Elo des échecs s'étale typiquement sur plusieurs centaines, voire plus d'un millier de points ; une bande de 131 points sur tout un champ, du haut en bas, décrit un ensemble de modèles qui, en termes de préférence humaine, sont bien plus proches les uns des autres que ne le suggèrent les titres « à la pointe » consacrés à tel ou tel modèle. Le rang 15 (FLUX.2 [max], 1072) et le rang 20 (Z-Image Turbo, 1057) diffèrent de moins que l'écart entre les rangs 1 et 2 — un utile garde-fou contre le fait de lire un rang précis au milieu du tableau comme une différence de capacité significative plutôt que du bruit à l'intérieur d'un champ étroitement regroupé.

Ce qui n'a pas encore été vérifié indépendamment

C'est le propre jeu de données de Datapoint, sa propre méthodologie, et son propre tableau Elo publié — le fait que les annotations elles-mêmes soient ouvertes et téléchargeables est ce qui rend une reproduction indépendante possible, mais personne en dehors de Datapoint n'a encore mené cette reproduction à la date de ce billet. Le même standard s'applique ici qu'à tout classement auto-publié : les données ouvertes constituent un vrai travail de fond pour la crédibilité, pas un substitut à ce que quelqu'un d'autre recalcule les scores Elo à partir des annotations brutes et confirme que le classement tient.

À surveiller

  • Le recalcul indépendant des scores Elo à partir des données brutes d'annotation. Le jeu de données est ouvert précisément pour rendre cela possible — que le classement publié survive à un passage indépendant est le vrai test de cette publication.
  • Si le motif « les fermés dominent le sommet » tient à mesure que les modèles d'image ouverts progressent. Hunyuanimage 3.0 au 17e rang est la meilleure performance ouverte actuelle ; si la prochaine génération de modèles d'image ouverts referme cet écart d'environ 65 points avec les leaders est une cible traçable et précise.
  • Ce que la subvention de données d'1 million de dollars finance réellement. Une subvention annoncée aux côtés d'une publication de benchmark est un engagement énoncé auquel on peut la tenir — à vérifier ce qui est financé et d'ici quand.

Références : Datapoint AI sur X — annonce · Hugging Face — datapointai/text-2-image-human-preferences-2m · couverture liée : FLUX 3 · DiffusionGemma · Qwen3.8-27B · Frontier Arcade : tendances et prédictions