Des chercheurs de l'équipe MiMo de Xiaomi, de l'Université de Pékin, de l'Université de Hong Kong et de l'Université Renmin ont publié CodeMidas : un pipeline qui construit des tâches d'entraînement par renforcement (RL) directement à partir de code source existant, plutôt qu'à partir de tickets, de pull requests ou de commits comme le font les pipelines précédents (SWE-bench, SWE-rebench). Un agent explore les fonctionnalités implémentées d'un dépôt, en rédige une spécification comportementale, la retire pour créer un point de départ, construit des tests ancrés dans l'exécution réelle du code d'origine, puis filtre les candidats par des exécutions adversariales (vérifiant si la spécification laisse fuiter la réponse) et des tentatives de résolution répétées.
Le résultat est 5 545 tâches d'entraînement issues de 3 185 dépôts couvrant 23 langages. Entraîner MiMo-V2.5 dessus avec GRPO améliore les cinq benchmarks externes testés : le taux de réussite sur DeepSWE passe de 10,0 % à 21,7 %, Terminal-Bench v2.1 de 63,7 % à 72,2 %, le score « Almost Solved » de ProgramBench de 4,5 à 21,5, avec en plus des gains sur SWE-bench Pro et RepoZero C2Rust. L'ensemble de tâches et les ensembles de benchmarks sont confirmés disjoints.
La qualité l'emporte nettement sur l'échelle
Le résultat le plus tranchant de l'article est une ablation que peu de publications prendraient la peine de faire tourner : un sous-ensemble de 3 000 tâches filtrées surpasse un ensemble de 8 000 tâches échantillonnées avant le passage du pipeline de filtrage, sur chacune des trois métriques testées. Le filtrage — vérifications de cohérence d'exécution, sondes adversariales de fuite, revue des solutions — élimine plus de 5 000 candidats bruts et laisse malgré tout un ensemble d'entraînement qui les surpasse tous. C'est un résultat réellement utile et vérifiable sur où investir l'effort d'ingénierie en construisant des environnements RL, plus informatif que les gains de taux de réussite mis en avant.
Personne ne dit quel modèle construit les données d'entraînement
Voici la lacune qui mérite d'être nommée : à aucun moment dans l'article — ni dans la section méthode, ni dans le tableau de l'annexe qui liste pourtant l'intégralité de la configuration d'entraînement, jusqu'au taux d'apprentissage, aux paramètres bêta d'Adam et au seuil d'écrêtage du gradient — n'est précisé quel modèle fait tourner CodeMidas lui-même. L'agent qui explore les dépôts, rédige les spécifications, construit les tests, exécute les tentatives adversariales et évalue les solutions candidates face aux décisions du vérificateur n'est jamais nommé. Seul le modèle entraîné sur le résultat, MiMo-V2.5, est précisé.
Ce n'est pas un détail mineur. Si le pipeline lui-même tourne sur MiMo, un modèle Xiaomi génère et note le curriculum qui entraîne ensuite un modèle Xiaomi ultérieur — une boucle d'auto-renforcement qu'il vaut la peine de connaître, sans nécessairement invalider le résultat, mais une affirmation différente de celle d'un jeu de données construit indépendamment. S'il tourne sur un modèle tiers plus puissant, c'est une histoire de coût et de reproductibilité sensiblement différente de ce que suggère le cadrage de l'article. Dans un cas comme dans l'autre, c'est la seule précision qu'un lecteur ne peut pas obtenir de cet article et qui changerait pourtant la lecture de chaque chiffre qu'il contient.
Le lancement de MiMo-V2.6 par Xiaomi, trois semaines après ce prépublication, invoquait la « RSI » — l'auto-amélioration récursive — pour décrire le passage à l'échelle du RL sur des tâches vérifiables. CodeMidas en est une instance concrète : un pipeline qui fabrique son propre signal d'entraînement à partir de matière première brute, sans énoncé de tâche curaté par des humains. Reste à voir si le modèle qui construit le curriculum sera un jour nommé.