Black Forest Labs — le laboratoire de Fribourg d'environ 100 personnes fondé par les auteurs originaux de Stable Diffusion, désormais valorisé à 3,25 milliards de dollars après sa série B de décembre — a annoncé FLUX 3 le 23 juillet 2026. Et ce qui est intéressant, ce n'est pas la qualité d'image. C'est la thèse.
D'un modèle d'image à une « intelligence visuelle »
FLUX.1 et FLUX.2 étaient des modèles d'image, point final — d'excellents modèles, à poids ouverts, l'ossature de la moitié de l'écosystème des outils créatifs. FLUX 3 est présenté différemment : une architecture unifiée unique, entraînée conjointement sur l'image, la vidéo et l'audio, qui « peut aussi être étendue pour prédire des actions ». L'affirmation de BFL, dans les mots du PDG Robin Rombach, est que la véritable intelligence signifie « percevoir le monde : prédire comment il va changer, agir, et apprendre des résultats » — et que la génération d'images, la génération de vidéos, les modèles du monde et la robotique sont tous des « expressions d'une même capacité sous-jacente ».
La version concrète de cette affirmation : BFL affirme que la génération vidéo et la prédiction d'actions n'exigent pas de fondations séparées — le même modèle s'étend pour prédire des actions robotiques sans sacrifier ses capacités vidéo, et chaque modalité d'entraînement renforce les autres.
Trois variantes, déploiement échelonné
- FLUX 3 Video — génération vidéo avec audio natif synchronisé en option, en accès anticipé dès maintenant. BFL affirme qu'elle « est déjà en tête dans les évaluations précoces face aux modèles vidéo de pointe », avec une force particulière dans les expressions faciales humaines, l'association des sons aux événements physiques et la capacité multilingue — bien qu'aucun chiffre de benchmark ni classement d'arène n'ait encore été publié ; ceux-ci sont promis « en même temps qu'une disponibilité plus large ».
- FLUX 3 Action — le volet robotique de la thèse, également en accès anticipé. Le déploiement phare est FLUX-mimic, un modèle vidéo-action construit avec la startup suisse mimic robotics, déjà en phase de test chez des fabricants dont Audi — des manipulateurs dextres à double bras effectuant de la manipulation de corps souples sur des lignes de production. Ce n'est pas une bande de démonstration ; c'est une usine automobile.
- FLUX 3 Image — édition précise avec cohérence des produits et des matériaux, déploiement dans les semaines à venir.
Le nombre de paramètres, les licences et les tarifs restent tous non divulgués pour l'instant, mais BFL s'est engagé à proposer des versions plus rapides et à poids ouverts de FLUX 3 plus tard cette année — avec une justification explicitement teintée de robotique : un déploiement local à faible latence pour les systèmes de contrôle robotique, et un affinage sur les données des clients. Parmi les premiers testeurs figurent Canva, Burda, Magnific de Freepik, Krea et Picsart.
Pourquoi cela vaut la peine d'être suivi
De nombreux laboratoires font de la génération vidéo, et de nombreux développent des politiques robotiques — le pari qu'il s'agit du même modèle est plus rare, et BFL est exceptionnellement bien placé pour le tester : un laboratoire européen avec une crédibilité authentique en matière de poids ouverts, une qualité d'image de pointe comme point de départ, et un véritable partenaire industriel déployant la variante d'action sur de réelles lignes de production. Cela résonne aussi avec la direction que le reste du secteur a prise cette année — Cosmos 3 de NVIDIA a unifié prédiction/transfert/raisonnement/action en une seule architecture pour l'IA physique il y a tout juste une semaine. Si l'« intelligence visuelle » s'avère être un fondement unique, il se pourrait que les laboratoires de modèles d'image se révèlent avoir toujours été des laboratoires de robotique.
Liens
- Annonce : FLUX 3 — Black Forest Labs