2026-09-01

Atlas de World Labs fusionne génération et reconstruction 3D en un seul modèle

AI🌍 North America

World Labs a annoncé Atlas le 1er septembre 2026, le présentant comme « le premier modèle du monde multimodal qui génère des images et des trames vidéo avec un contrôle de caméra au pixel près et les reconstruit en 3D ». Le positionnement de l'entreprise : « modéliser le monde, déplacer la caméra, et simuler l'espace et le temps ».

Ce qu'Atlas fait concrètement

Atlas est un transformeur de diffusion autorégressif multimodal — un seul modèle qui traite ensemble texte, images, vidéo et données 3D dans ce que World Labs appelle un cadre spatial unifié, plutôt que de router entre plusieurs modèles spécialisés distincts. Concrètement, cela signifie qu'il peut générer des images et des trames vidéo jusqu'à 1440p et une minute de durée avec un mouvement de caméra précis et contrôlable ; reconstruire une scène 3D complète à partir d'une seule image en entrée ; recadrer une vidéo existante pour simuler différentes trajectoires de caméra dans le même espace ; et composer plusieurs images posées d'une scène en une seule reconstruction 3D cohérente. World Labs affirme qu'Atlas dépasse les modèles de reconstruction open source existants sur ce dernier point, mais il s'agit d'une déclaration de l'entreprise, pas d'un résultat de benchmark vérifié indépendamment.

Le fait que génération et reconstruction soient le même modèle, plutôt qu'un générateur alimentant un pipeline de reconstruction séparé, constitue la véritable affirmation architecturale ici — tout le reste découle du traitement de « créer une scène » et « reconstruire une scène » comme deux facettes d'une même représentation sous-jacente.

De Marble à Atlas

Atlas est la quatrième étape d'une séquence assez délibérée. Marble est sorti en novembre 2025 comme premier produit commercial de World Labs : génération de mondes 3D à partir d'images ou de texte, vendue directement aux utilisateurs. En janvier 2026, l'entreprise a ouvert la World API, donnant aux développeurs et aux équipes de robotique un accès programmatique à cette même capacité de génération, au-delà de la seule application grand public. En juillet 2026, elle a acquis SceniX, une entreprise de simulation robotique fondée par les professeurs de Columbia Yunzhu Li et Changxi Zheng, construite autour d'un pipeline « réel-vers-simulation-vers-réel » : numériser un environnement réel, entraîner la politique d'un robot dans le jumeau numérique, puis déployer le comportement appris dans le monde physique. Atlas est le modèle dont ce pipeline a besoin — reconstruire des scènes 3D précises à partir de séquences réelles est la moitié « réel-vers-simulation » de cette boucle, et c'est exactement la capacité que World Labs met désormais en avant, au-delà du positionnement grand public initial de Marble.

L'accès anticipé se déploiera dans les prochaines semaines plutôt que d'être disponible largement dès le premier jour.

Le pari à un milliard de dollars derrière tout cela

World Labs a levé 230 millions de dollars pour son lancement en septembre 2024, puis a bouclé un tour de table d'un milliard de dollars en février 2026 à une valorisation d'environ 5 milliards de dollars, avec AMD, Nvidia, Autodesk, Emerson Collective, Fidelity et Sea parmi les investisseurs — Autodesk a à elle seule investi 200 millions de dollars et occupe un rôle de conseil. La thèse qui sous-tend tout cela, dans la formulation même de Fei-Fei Li, est que les modèles du monde, plutôt que les modèles de langage, constituent la prochaine frontière de l'IA — qu'apprendre à un système à raisonner sur l'espace en 3D est un problème différent et, selon elle, plus déterminant que de continuer à faire monter en échelle la prédiction de texte. Atlas est à ce jour l'expression technique la plus claire de ce pari : non pas un chatbot doté d'un module 3D, mais un modèle conçu dès le départ pour traiter génération et reconstruction spatiale comme une seule et même tâche.

Où cela se situe parmi les modèles du monde

Atlas n'est pas le seul objet appelé « modèle du monde » cette année. Genie 3 de Google DeepMind, sorti en août 2025, génère des environnements interactifs en temps réel en 720p à 24 images par seconde, qu'un utilisateur peut parcourir trame par trame, avec environ une minute de mémoire. Les deux ne répondent pas vraiment à la même question. Genie 3 est optimisé pour l'interactivité en direct et jouable ; Atlas est optimisé pour une sortie précise à caméra contrôlée et une reconstruction 3D explicite à partir d'une entrée minimale — plus proche d'un outil de production et de simulation que d'un monde interactif à parcourir. Les deux entreprises convergent vers le cadre de « l'intelligence spatiale », mais depuis les deux extrémités opposées du même problème.