2026-09-24

Jürgen Schmidhuber rejoint Sakana AI comme conseiller scientifique en chef de son nouveau RSI Lab

AIResearch🌍 Asia

Jürgen Schmidhuber rejoint Sakana AI. Sakana a annoncé le 24 septembre que le chercheur derrière LSTM et certains des tout premiers travaux sur le méta-apprentissage et les modèles de monde « rejoint officiellement Sakana AI comme conseiller scientifique en chef » de son « RSI Lab nouvellement créé », un groupe tokyoïte visant « à déclencher un cycle cumulatif de découverte scientifique visant à améliorer l'intelligence des machines ». Pour un laboratoire qui a bâti son identité sur l'IA auto-améliorante, c'est un recrutement majeur : la thèse de 1987 de Schmidhuber décrivait un programme qui améliore son propre algorithme d'apprentissage, et la Darwin Gödel Machine de Sakana descend directement de son idée de machine de Gödel. Voir la page du RSI Lab.

Ce qu'il fera réellement

Le rôle est consultatif. La page du laboratoire dit qu'il « conseillera le laboratoire » et « sera régulièrement à Tokyo pour rencontrer l'équipe », et il conserve sa direction de l'AI Initiative à KAUST. La relation n'est pas nouvelle : le PDG de Sakana, David Ha, a co-écrit l'article « World Models » de 2018 avec lui. Le RSI Lab a été lancé début juin : il a donc environ trois mois et demi.

L'annonce de Sakana le qualifie d'« universellement reconnu comme le père de l'IA moderne ». Les travaux sont réels, mais « universellement » passe sous silence ses longs différends de priorité avec Hinton, LeCun et Bengio (un rapport de 88 pages, qui énumérerait 17 réclamations précises).

Ce que le laboratoire a montré, et ce qu'il promet

La page énumère la lignée de Sakana : LLM² (un algorithme d'optimisation de préférences découvert par un LLM), la Darwin Gödel Machine, ShinkaEvolve, ALE-Agent, Digital Red Queen et The AI Scientist. La Darwin Gödel Machine est ce qui se rapproche le plus de l'« auto-amélioration » : elle a fait passer un agent de codage de 20 % à 50 % sur SWE-bench (les « 30 points de pourcentage d'amélioration absolue » de la page) en réécrivant son propre échafaudage autour d'un modèle de fondation figé. La troisième phase de la feuille de route est le saut au-delà, « des agents d'IA qui écrivent, évaluent et vérifient activement le code de leurs propres architectures de fondation sous-jacentes », énoncé comme un objectif, pas un résultat. Le lancement de Xiaomi a reçu ici la même critique pour avoir traité « la voie RSI » comme une affirmation sans réserve.

L'affirmation sur le calcul se contredit

L'argument central de la page est que le RSI est réalisable « sur un calcul modeste et économe en échantillons », et que Sakana construit « non pas le moteur d'auto-amélioration le plus gourmand en calcul, mais le plus économe en échantillons ». Ses preuves : ShinkaEvolve (« seulement 150 échantillons ») et ALE-Agent, qui selon la page a « surpassé 804 spécialistes humains de l'heuristique... non pas en brûlant plus d'inférence ». Pourtant, l'entrée d'ALE-Agent elle-même, plus haut sur la même page, dit qu'il a fonctionné en « tirant parti d'une mise à l'échelle massive à l'inférence et d'un mécanisme d'auto-apprentissage ». Les deux ne peuvent pas être le résumé. Et 150 échantillons sur un problème d'optimisation précis montrent une recherche de programmes efficace, pas que l'amélioration de la boucle d'entraînement d'un modèle de fondation soit bon marché.

Sécurité : une vraie section, mais une posture, pas un protocole

La page comporte une section « Toward Responsible RSI », meilleure que la plupart. Elle nomme des modes de défaillance que Sakana dit avoir observés directement : « des boucles évolutives qui dérivent hors distribution, des auto-modifications qui passent les benchmarks mais échouent en déploiement, des agents qui trouvent des raccourcis autour des contraintes qu'on leur a données », les qualifie de « problème d'ingénierie central », et promet de « publier ouvertement, y compris les résultats négatifs, et de concevoir nos boucles d'auto-amélioration avec des garde-fous vérifiables dès le départ ».

Aucune précision : pas de description du bac à sable (l'article de la Darwin Gödel Machine en avait un), pas de conditions d'arrêt, pas de supervision nommée, pas de définition de « vérifiable ». Deux tensions se trouvent à côté :

  • Cyber. Digital Red Queen est présenté comme « la base de l'application du RSI à la cybersécurité, modélisant comment des agents autonomes peuvent co-évoluer en continu pour découvrir, exploiter et corriger des vulnérabilités », et le texte de recrutement veut des scientifiques appliquant la dynamique évolutive à « la cybersécurité et au red-teaming automatisé ». Fugu-Cyber gardait un humain dans la boucle avant que quoi que ce soit ne soit déclaré réel ; ce cadrage ne dit pas la même chose.
  • Diffusion. La phase quatre est « l'IA démocratisée », l'auto-amélioration comme « bien public plutôt qu'actif où le vainqueur rafle tout », sur un calcul accessible à tous. La section sécurité traite des modes de défaillance des propres boucles de Sakana, pas de ce qui se passe une fois qu'une recette de RSI bon marché est publiée. La logique de souveraineté est celle que ce blog a lue dans Namazu : une stratégie réelle, contrainte en calcul, pour le Japon, la question ouverte étant de savoir si la contrainte produit de l'efficacité ou simplement des ambitions plus petites.

À lire ensuite