2026-09-20

Quelqu'un a republié tout arXiv sur Hugging Face — Google héberge déjà les mêmes fichiers gratuitement, et les conditions d'arXiv disent de ne pas le faire

AIOpen SourceData🌍 Global

Un jeu de données nommé arXiv Complete Corpus est apparu sur Hugging Face : 3 148 796 articles avec métadonnées, historique des versions, fichiers de soumission et documents rendus, incluant le contenu des fichiers, leurs chemins, leurs tailles et leurs empreintes SHA-256. Selon sa propre description, il contient un PDF pour 99,47 % des articles et 99,54 % des versions « déclarées avec une taille de soumission non nulle », les métadonnées provenant de l'interface OAI-PMH d'arXiv et les fichiers « du miroir GCS, des archives sources S3 et de téléchargements directs de PDF ». Il est présenté comme un instantané ponctuel, avec des lacunes de couverture documentées.

Quiconque a déjà tenté de constituer un tel ensemble comprend pourquoi quelqu'un l'a fait. Réconcilier trois des canaux d'accès d'arXiv en un seul schéma, avec des sommes de contrôle et un historique des versions qui s'aligne réellement, représente quelques semaines de travail ingrat que refait indépendamment chaque laboratoire qui en a besoin. Un corpus figé et vérifiable par empreintes est un objet réellement utile.

C'est aussi, pour l'essentiel de son contenu, une chose que les auteurs de ces articles n'ont jamais autorisé qui que ce soit à publier. Et le plus curieux est le peu que cette republication apporte, puisque les fichiers étaient déjà libres d'accès.

Les métadonnées sont en CC0. Les articles, non.

Ces deux moitiés ont un statut juridique entièrement différent, et c'est en les confondant que l'on construit ce genre de corpus.

Les métadonnées d'arXiv — titres, auteurs, résumés, catégories, historiques de versions — sont publiées sous CC0 1.0, une renonciation au droit d'auteur. On peut les copier, les reconditionner, les vendre, sans autorisation. Tout ce qui, dans ce corpus, décrit un article est parfaitement en règle.

Les articles eux-mêmes relèvent d'une autre logique, et arXiv est remarquablement direct à ce sujet. Les auteurs conservent leurs droits ; l'immense majorité soumet sous la licence par défaut d'arXiv, qui accorde à arXiv un droit de distribution perpétuel et non exclusif, et n'accorde rien à personne d'autre. Les conditions d'utilisation de l'API sont aussi nettes qu'un document de politique peut l'être : « Vous ne devriez pas stocker ni servir des e-prints arXiv depuis vos propres serveurs sans l'autorisation du titulaire des droits ou si l'e-print n'a pas été soumis sous une licence qui permet la redistribution », suivi de la précision qui compte — « un très petit sous-ensemble des e-prints arXiv est soumis sous des licences qui permettent la redistribution ». La page sur les réutilisations ajoute qu'arXiv « n'est pas en mesure d'accorder à des tiers le droit de distribuer les articles arXiv », ce qui ferme le contournement évident consistant à demander à arXiv.

Quelle est la taille de ce « très petit sous-ensemble » ? Une analyse communautaire sur le forum d'Open Knowledge évaluait les licences non par défaut à 3,42 % des dépôts depuis 2015 — soit environ 96,6 % sous la licence par défaut. Ce chiffre est ancien et non officiel, et la part sous licence Creative Commons a certainement augmenté depuis, en particulier en apprentissage automatique où le CC-BY relève presque de la norme. Mais il faudrait qu'elle ait été multipliée par dix pour changer la nature du problème. Selon toute répartition plausible, un corpus comprenant un PDF pour 99,47 % d'arXiv comprend plusieurs millions de PDF dont les titulaires de droits ont accordé une licence de distribution à une seule organisation, et ce n'est pas Hugging Face.

Rien de tout cela n'est inhabituel pour un jeu de données d'IA, et c'est précisément le point. Ce qui est inhabituel, c'est à quel point c'était inutile ici.

Les fichiers étaient déjà gratuits, sur un miroir qu'arXiv a contribué à mettre en place

C'est ce qui rend cette publication réellement déroutante, et pas seulement juridiquement exposée.

arXiv ne dissimule pas son texte intégral derrière un péage ou une négociation. L'archive propose un accès en masse par plusieurs canaux. Celui qui compte ici est gs://arxiv-dataset, un miroir Google Cloud Storage mis en place en partenariat avec arXiv, contenant les PDF et les fichiers sources, téléchargeable gratuitement, mis à jour chaque semaine. Pas de facturation au demandeur. Aucune restriction d'accès. Une commande gsutil, indéfiniment, pour qui le souhaite.

La description du corpus indique elle-même que ses fichiers proviennent « du miroir GCS, des archives sources S3 et de téléchargements directs de PDF ». Le pipeline part donc d'une source officielle, gratuite et continuellement mise à jour — et aboutit à une copie statique appartenant à un tiers. Cette republication n'ouvre aucun accès qui n'existait pas, à aucun public qui en était exclu. Elle déplace des octets d'un miroir qu'arXiv a autorisé vers un miroir que les conditions d'arXiv visent spécifiquement.

L'autre canal, le compartiment arxiv sur S3, facture au demandeur, et c'est le seul endroit où apparaît un coût réel : environ 9,2 To en avril 2025, avec une croissance d'à peu près 100 Go par mois, à des tarifs de sortie qui représentent quelques centaines de dollars pour l'ensemble. C'est la friction réelle qu'impose la voie officielle — une facture cloud gérable et un peu de patience — et c'est exactement la friction que le modèle S3 existe pour créer, afin qu'arXiv puisse ouvrir sa porte à tous sans payer la bande passante de tous.

Ce qu'il apporte vraiment, c'est le manifeste — et le manifeste est la partie propre

Retirez les octets des fichiers et regardez ce qui reste : un schéma unifié couvrant métadonnées, historique des versions et fichiers ; des chemins et des tailles ; des empreintes SHA-256 pour chaque fichier ; et des lacunes de couverture documentées honnêtement. Voilà la contribution. Les empreintes sont ce qui transforme un amas de téléchargements en objet auditable : on peut prouver que sa copie correspond, détecter un transfert tronqué, et citer un corpus par son contenu plutôt que par une promesse. L'historique des versions réconcilié avec les fichiers est la pièce qu'aucun canal d'arXiv ne livre assemblée.

Et l'argument de reproductibilité en faveur d'un instantané figé est réel, d'une façon que l'argument de redondance ci-dessus n'entame pas. On ne peut pas citer gs://arxiv-dataset dans un article et désigner quoi que ce soit de précis, puisque le miroir a changé la semaine suivant l'expérience. « Le corpus tel qu'il était à cette date, avec ces empreintes » est un objet citable, ce qu'un miroir hebdomadaire ne pourra jamais être. C'est un manque légitime, et cette publication le comble.

Voilà le point : la partie qui le comble est précisément la partie juridiquement propre. Une empreinte SHA-256 est un fait à propos d'un fichier, pas une copie de ce fichier. Les chemins, les tailles, les numéros de version, les horodatages et les statistiques de couverture sont des faits. Les métadonnées sont en CC0. Une publication réduite au manifeste — chaque empreinte, chaque chemin, chaque version, plus un script qui télécharge depuis gs://arxiv-dataset et vérifie les empreintes — livre le corpus figé, auditable et citable sans republier un seul octet appartenant à autrui. Les chercheurs obtiennent une reproductibilité au bit près, les conditions d'arXiv restent intactes, et l'objet survit.

Ce n'est pas une subtilité juridique, c'est une meilleure conception. Les quelque neuf téraoctets sont la partie la moins intéressante et la plus encombrée de l'ensemble, et c'est celle que le miroir officiel servait déjà gratuitement.

Le chiffre de couverture repose sur un dénominateur soigneusement construit

Rendons justice aux auteurs : « 99,54 % des versions déclarées avec une taille de soumission non nulle » est une formulation précise et honnête, et la plupart des fiches de jeux de données ne s'embarrasseraient pas de la nuance. Il vaut la peine de voir ce qu'elle fait.

arXiv déclare une taille de soumission nulle pour les versions sans fichier récupérable : retraits, soumissions problématiques, enregistrements dont la source n'a jamais été conservée. Les exclure du dénominateur se défend — on ne peut pas reprocher l'absence d'un fichier qui n'existe pas. Mais cela signifie que le chiffre annoncé n'est pas « 99,5 % d'arXiv », mais « 99,5 % de la portion d'arXiv qui était récupérable en principe », et l'ensemble exclu est précisément là où se trouvent les enregistrements gênants. Au niveau des articles, 99,47 % de 3 148 796 laisse tout de même environ 16 700 articles sans aucun PDF — une lacune de la taille d'un serveur de préprints de taille moyenne, divulguée plutôt qu'enfouie.

L'instantané d'une chose qui ne tient pas en place

La publication se qualifie elle-même d'instantané ponctuel, et le mot est juste, mais il sous-estime la vitesse d'obsolescence. Selon les propres chiffres S3 d'arXiv, l'archive croît d'environ 100 Go par mois, et arXiv reçoit plus de 20 000 nouvelles soumissions mensuelles. Un arXiv complet aujourd'hui est mesurablement incomplet le mois prochain et sérieusement périmé en un an.

Pour l'usage de reproductibilité, c'est une qualité — on veut qu'il soit figé. Pour qui lit « corpus complet » comme « le corpus que vous pourrez continuer d'utiliser », c'est un piège, et l'écart entre ces deux lectures est l'endroit où ce genre de jeu de données part à l'abandon sur une plateforme.

L'hébergeur a changé de propriétaire il y a trois semaines

Les corpus de cette forme ont une histoire, et elle est courte. Books3 — 196 640 livres récupérés sur une bibliothèque pirate, environ 37 Go — a servi trois ans d'ingrédient standard pour l'entraînement de modèles de langue avant que le groupe antipiratage danois Rights Alliance n'envoie des notifications DMCA en août 2023. Le jeu de données a disparu de The Eye, et la page Hugging Face est devenue defunct-datasets/the_pile_books3. Hugging Face publie les notifications qu'elle reçoit dans un dépôt public de notifications de retrait, ce qui constitue une excellente pratique de transparence et, accessoirement, la preuve permanente que la voie du retrait est empruntée et qu'elle fonctionne.

Les préprints arXiv ne sont pas des copies de Bibliotik : les auteurs les déposent pour être lus, la plupart seraient ravis de figurer dans un corpus d'entraînement, et arXiv n'est pas un plaignant antipiratage. L'asymétrie est réelle et c'est pourquoi ce corpus restera probablement en place sans être inquiété. Mais « les titulaires de droits n'y verront sans doute pas d'inconvénient » est un pari portant sur trois millions de titulaires distincts, dont certains sont des éditeurs disposant d'un accord de cession et d'un budget contentieux.

Ce qui change cette fois, c'est le propriétaire des murs. NVIDIA a conclu le rachat de Hugging Face il y a trois semaines, à un prix annoncé au dollar près. Une plateforme d'hébergement tenue par une jeune pousse et une plateforme détenue par l'une des entreprises les plus valorisées au monde reçoivent les mêmes notifications et n'ont pas du tout les mêmes incitations quant à la rapidité d'y donner suite. Personne n'envoie de courrier spéculatif à une jeune pousse sans bilan. Beaucoup en enverront à NVIDIA.


Le bon cadre ici n'est pas le piratage, c'est la proportionnalité. Il s'agit d'un artefact remarquablement bien fait — provenance documentée, empreintes partout, lacunes de couverture énoncées plutôt qu'arrondies — et ce soin est précisément ce qui rend le manquement sur les licences irritant. Quelqu'un d'assez soucieux de reproductibilité pour publier une empreinte SHA-256 de chaque fichier d'un corpus de trois millions d'articles était à deux décisions de conception d'une publication que personne n'aurait jamais eu à faire retirer.

Le motif plus général est celui que ce blog rencontre sans cesse du côté des modèles : « ouvert » décrit un spectre, ce sont les conditions attachées à un artefact qui déterminent ce que l'on peut réellement construire dessus, et la partie de la pile que l'on vérifie en dernier est celle qui décide si le travail survivra au contact d'un juriste. C'est tout aussi vrai des jeux de données, et davantage lourd de conséquences : un modèle aux conditions de licence gênantes se remplace. Un corpus qui disparaît emporte avec lui toutes les expériences bâties dessus.

Sources : conditions d'utilisation de l'API arXiv · réutilisations et autorisations arXiv · accès en masse arXiv · métadonnées arXiv sur Kaggle (CC0) · notifications de retrait Hugging Face · TorrentFreak sur le retrait de Books3