Datapoint AI a publié ce qu'elle présente comme le plus grand jeu de données ouvert de préférences humaines pour la génération d'images : plus de 2 millions d'annotations par paires réalisées par de vraies personnes, classant 30 modèles d'image actuels sur 10 catégories d'usage — marketing, design de produit, anime, et d'autres — accompagné d'une subvention de données d'1 million de dollars pour de futurs travaux dans ce domaine. Le jeu de données lui-même est sur Hugging Face. La méthodologie mérite d'être prise au sérieux pour elle-même avant d'en venir à ce que les classements montrent réellement.
La préférence humaine par paires est le bon instrument, et il est plus rare qu'il ne devrait l'être
La plupart des comparaisons de modèles d'image s'appuient encore sur des notateurs esthétiques automatisés ou des métriques de similarité CLIP — des approximations de ce qu'une personne préférerait réellement, pas la préférence elle-même. L'approche de Datapoint se rapproche du modèle du LMSYS Chatbot Arena pour le texte : de vraies personnes regardent deux sorties côte à côte et en choisissent une, agrégées en un score Elo sur suffisamment de comparaisons pour que le bruit s'annule en moyenne. Avec plus de 2 millions d'annotations sur 30 modèles, c'est une taille d'échantillon substantielle pour ce genre d'étude. Et la répartition par catégorie (marketing, design de produit, anime, et sept autres) signifie que le classement ne compresse pas chaque cas d'usage en un seul score de « qualité » indifférencié comme le fait tendanciellement un chiffre agrégé unique.
Il vaut aussi la peine de le nommer clairement : Datapoint est une entreprise d'annotation de données — publier le plus grand jeu de données de préférences humaines disponible pour cette tâche est une démonstration directe du pipeline qu'elle vend, pas un exercice académique désintéressé. Cela ne rend pas les données fausses, mais c'est le même genre d'intérêt propre qui mérite d'être noté pour l'affirmation de tout créateur de benchmark sur son propre benchmark, et les lecteurs devraient évaluer la méthodologie sur ses mérites plutôt que sur la seule étiquette « le plus grand au monde ».
Les sept premiers sont tous fermés
En comptant directement le propre tableau Elo de Datapoint : GPT Image 2 (high) mène à 1131, suivi de Seedream 5.0 Pro (1127), Nano Banana 2 (1122), Reve 2.1 (1113), MAI-Image-2.5 (1109), Nano Banana Pro (1106), et GPT Image 1.5 (high) (1103). Chacun de ces sept est un modèle fermé, accessible uniquement par API. Le premier modèle véritablement en poids ouverts de la liste — Hunyuanimage 3.0, de Tencent — se situe au 17e rang (1066), à environ 65 points Elo du leader. FLUX.1 [schnell], la sortie rapide en poids ouverts de Black Forest Labs, est dernier au 30e rang (1000). Ce résultat précis relève moins d'un écart de capacité que d'un compromis attendu : « schnell » est explicitement optimisé pour la vitesse au détriment de la qualité, et finir dernier sur un benchmark de pure préférence est proche de la forme voulue de ce compromis plutôt qu'une surprise.
Cela dit, la tendance mérite d'être énoncée clairement plutôt que sous-entendue : sur ce jeu de données précis, à ce moment précis, la préférence humaine pour la qualité générale de génération d'images favorise actuellement les modèles fermés sur toute la ligne, les poids ouverts occupant les paliers intermédiaires et inférieurs plutôt que de rivaliser en tête. C'est une image différente de celle des modèles de langage, où les sorties en poids ouverts ont régulièrement égalé ou battu les modèles fermés de pointe sur des benchmarks individuels ce mois-ci. Savoir si la génération d'images est un paysage concurrentiel authentiquement différent, ou simplement plus en amont de la même courbe de rattrapage que les modèles de texte ont déjà parcourue, reste une question ouverte.
Une bande Elo étroite ne veut pas dire que le champ est serré
L'autre caractéristique très citée du tableau est sa compression : l'ensemble des 30 modèles s'étale de 1131 à 1000 — une bande de seulement 131 points Elo, du leader au modèle délibérément rapide et bon marché en bas de tableau. Il est tentant d'y lire la preuve que le champ est très regroupé et qu'aucun modèle n'est significativement devant. Cette inférence ne tient pourtant pas, car la largeur d'un tableau Elo est en grande partie une propriété de la façon dont les scores ont été calculés, pas de la proximité réelle des modèles.
Les scores Elo n'ont pas de signification absolue, et leur étalement ne se lit pas directement dans les données : il découle de choix méthodologiques — la valeur d'initialisation, le facteur K (ou la force de régularisation dans un ajustement Bradley–Terry), et la composition du panel de modèles. C'est bien établi pour les systèmes de classement en général. Un indice ici : le dernier du classement, FLUX.1 [schnell], se trouve exactement à 1000 — la note de départ conventionnelle par défaut. Cela suggère que l'échelle est ancrée à ce plancher et que les estimations sont tirées vers lui, comprimant la plage visible plutôt que de rapporter un véritable plafond de 131 points sur les différences.
La façon la plus nette de le voir est de regarder d'autres arènes de préférence humaine mesurant la même chose. Sur le classement text-to-image de LMArena — environ 5,9 millions de votes sur 76 modèles — les scores vont d'environ 897 à 1382, un étalement proche de 485 points. GPT Image 2 y détient ce que le classement décrit comme la plus grande avance sur le deuxième de toute son histoire. L'arène d'images d'Artificial Analysis raconte la même histoire : son premier modèle devance le deuxième de dizaines de points Elo, et de bien plus de 100 points les modèles quelques rangs plus bas. Même question sous-jacente — quelle image une personne préfère-t-elle ? — mais des étalements très différents, parce que la machinerie de notation diffère. La comparaison avec l'Elo des échecs, où des centaines de points séparent les niveaux, n'a donc jamais été à armes égales : 131 points sur l'échelle de Datapoint et 485 sur celle de LMArena ne sont pas les mêmes unités.
Rien de tout cela ne rend l'ordre de Datapoint faux. Cela signifie que la bande étroite est un fait sur le calcul Elo de Datapoint, pas une découverte sur les modèles — et « personne n'est vraiment loin devant » est précisément la lecture que l'étalement brut des points ne peut pas soutenir. Sur les grandes arènes publiques, au moins un modèle est très nettement en tête.
Le classement est confirmé par d'autres sources
L'ordre observé ici est confirmé par des sources indépendantes, il n'a donc pas besoin d'être recalculé à partir des annotations de Datapoint pour être crédible. Des classements de préférence humaine pour les modèles d'image sont publiés en continu, et à plus grande échelle, par des opérateurs sans intérêt dans les données de Datapoint : le classement text-to-image de LMArena et l'arène d'images d'Artificial Analysis mènent leurs propres votes, et le tableau d'ensemble que rapporte Datapoint — les modèles fermés en tête, les poids ouverts regroupés plus bas — est celui qu'ils montrent déjà. Ce qui distingue cette publication n'est pas l'ordre, mais le jeu de données ouvert de 2 millions de votes et la ventilation par catégorie qui l'accompagne.
À surveiller
- Le recalcul indépendant des scores Elo à partir des données brutes d'annotation. Le jeu de données est ouvert précisément pour rendre cela possible — que le classement publié survive à un passage indépendant est le vrai test de cette publication.
- Le schéma « les modèles fermés dominent le sommet » tiendra-t-il à mesure que les modèles d'image ouverts progressent ? Hunyuanimage 3.0, au 17e rang, est la meilleure performance ouverte du moment ; savoir si la prochaine génération refermera cet écart d'environ 65 points avec les leaders est une cible précise et suivable.
- Ce que la subvention de données d'1 million de dollars finance réellement. Une subvention annoncée aux côtés d'une publication de benchmark est un engagement énoncé auquel on peut la tenir — à vérifier ce qui est financé et d'ici quand.