Black Forest Labs — une centaine de personnes à Fribourg-en-Brisgau, fondé par les auteurs de Stable Diffusion et valorisé 3,25 milliards de dollars depuis sa série B de décembre — a annoncé FLUX 3 le 23 juillet 2026. L'intéressant n'est pas la qualité d'image, mais la thèse défendue.
Du modèle d'image à l'« intelligence visuelle »
FLUX.1 et FLUX.2 étaient des modèles d'image, rien de plus : d'excellents modèles à poids ouverts, sur lesquels repose la moitié de l'écosystème des outils créatifs. FLUX 3 se présente autrement — une architecture unifiée, entraînée conjointement sur l'image, la vidéo et l'audio, et qui « peut aussi être étendue à la prédiction d'actions ». Pour son PDG Robin Rombach, l'intelligence véritable consiste à « percevoir le monde, anticiper ses changements, agir et apprendre des résultats obtenus » ; génération d'images, génération de vidéos, modèles du monde et robotique ne seraient donc que des « expressions d'une seule et même capacité ».
Concrètement, BFL affirme que la génération vidéo et la prédiction d'actions n'ont pas besoin de fondations distinctes : le même modèle s'étend à la prédiction d'actions robotiques sans rien perdre de ses aptitudes vidéo, et chaque modalité d'entraînement renforce les autres.
Trois variantes, un déploiement progressif
- FLUX 3 Video — génération vidéo avec, en option, un audio natif synchronisé ; accès anticipé dès maintenant. BFL affirme que le modèle « domine déjà les premières évaluations face aux modèles vidéo de pointe », avec des points forts sur les expressions du visage, la synchronisation entre sons et événements physiques, et le multilingue. Aucun score de benchmark ni classement d'arène n'a toutefois été publié : ils sont promis « au moment d'une ouverture plus large ».
- FLUX 3 Action — le volet robotique, également en accès anticipé. Sa réalisation phare, FLUX-mimic, est un modèle vidéo-action développé avec la jeune pousse suisse mimic robotics. Il est déjà testé chez des industriels, dont Audi : des manipulateurs bimanuels de haute précision qui manipulent des matériaux déformables sur des lignes de production. Ce n'est pas une vidéo de démonstration, c'est une usine automobile.
- FLUX 3 Image — retouche fine, avec préservation de l'apparence des produits et des matières ; déploiement dans les semaines à venir.
Nombre de paramètres, licences et tarifs restent pour l'instant confidentiels. BFL s'est en revanche engagé à publier des versions plus rapides et à poids ouverts de FLUX 3 d'ici la fin de l'année, avec une justification ouvertement robotique : permettre un déploiement local à faible latence pour les systèmes de contrôle, et un affinage sur les données des clients. Parmi les premiers testeurs figurent Canva, Burda, Magnific (Freepik), Krea et Picsart.
Pourquoi cela mérite d'être suivi
Beaucoup de laboratoires font de la génération vidéo, beaucoup développent des politiques de contrôle robotique ; parier qu'il s'agit du même modèle est nettement plus rare. Et BFL est en très bonne position pour le vérifier : un laboratoire européen doté d'une vraie crédibilité sur le terrain des poids ouverts, une qualité d'image de premier plan comme point de départ, et un partenaire industriel qui déploie déjà la variante Action sur de vraies chaînes de montage. Le reste du secteur va d'ailleurs dans le même sens : il y a une semaine à peine, le Cosmos 3 de NVIDIA réunissait prédiction, transfert, raisonnement et action dans une architecture unique dédiée à l'IA physique. Si l'« intelligence visuelle » s'avère être un socle commun, on découvrira peut-être que les laboratoires de génération d'images étaient depuis le début des laboratoires de robotique.