Cet article contient des liens affiliés. En savoir plus.

FLUX 3 : Black Forest Labs génère image, vidéo et audio

Mis à jour en avril 2026

En résumé

Black Forest Labs, le laboratoire allemand derrière les modèles FLUX, a officialisé le 23 juillet 2026 FLUX 3 : un modèle de fondation entraîné conjointement sur l'image, la vidéo et l'audio. Il produit des clips jusqu'à 20 secondes avec son natif, enchaîne les séquences, et sert de socle à un modèle de prédiction d'action robotique testé par Audi. La diffusion démarre en accès anticipé, avec une version à poids ouverts annoncée pour plus tard dans l'année.

Points forts

  • Image, vidéo et audio dans un seul modèle
  • Clips jusqu'à 20 secondes avec audio généré nativement
  • Continuation de vidéo, keyframes et chaînage de clips
  • Rendu de texte multilingue nettement amélioré
  • Version à poids ouverts (FLUX 3 Dev) annoncée

Points faibles

  • Accès anticipé uniquement, sur sélection
  • Aucun tarif communiqué à ce jour
  • API et poids ouverts repoussés à plus tard dans l'année
  • 20 secondes reste court pour un format long
  • Usage robotique encore au stade du test industriel
OutilPrixNotePoints fortsPoints faiblesVerdict
#1 FLUX 3 (Black Forest Labs)
Non communiqué — accès anticipé 9/10 Image + vidéo + audio unifiés, 20 s natif, poids ouverts promis Accès restreint, tarifs inconnus À suivre de très près

Un modèle unique pour l'image, la vidéo et l'audio

Black Forest Labs a officialisé FLUX 3 le 23 juillet 2026. Là où la génération précédente séparait les modèles par modalité, FLUX 3 est entraîné conjointement sur l'image, la vidéo et l'audio — et sur la prédiction d'action, ce qui l'ouvre à la robotique.

Le laboratoire allemand s'était fait connaître avec les modèles FLUX d'image, devenus une référence des générateurs d'images IA open weights face à Midjourney et aux modèles propriétaires. FLUX 3 étend cette approche à l'ensemble des modalités visuelles et sonores.

20 secondes avec audio natif

La brique FLUX 3 Video génère des clips allant jusqu'à 20 secondes avec l'audio généré nativement, à partir d'un texte, d'une image ou d'une vidéo existante. C'est un saut par rapport aux durées de 5 à 10 secondes qui restaient la norme sur la plupart des générateurs vidéo.

Le modèle prend aussi en charge :

  • la continuation de vidéo — prolonger un plan existant ;
  • les transitions par keyframes — définir un début et une fin, laisser le modèle interpoler ;
  • le dialogue multilingue synchronisé avec l'image ;
  • la typographie à l'écran, longtemps le point faible des modèles vidéo ;
  • le chaînage de clips pour composer des séquences plus longues.

Côté image, FLUX 3 améliore le suivi de prompts complexes et le rendu de texte multilingue, deux points où les modèles précédents décrochaient dès qu'on sortait de l'anglais.

FLUX mimic : le même socle pour la robotique

L'annonce la moins attendue concerne la robotique. Le backbone vidéo de FLUX 3 est adapté à la prédiction d'action au sein de FLUX mimic, développé avec mimic robotics. Audi teste le système sur des tâches de manipulation robotisée en production.

La logique est cohérente : un modèle qui a appris à prédire la suite d'une séquence vidéo a, de fait, appris quelque chose de la physique du monde. Cette convergence entre génération vidéo et contrôle robotique est l'une des lignes de force de l'année 2026.

Disponibilité et poids ouverts

FLUX 3 Video et FLUX 3 Action sont proposés en accès anticipé, sur sélection. Black Forest Labs annonce pour plus tard dans l'année un accès API, des poids de modèle privés, et une version FLUX 3 Dev à poids ouverts — la formule qui a fait le succès des générations précédentes auprès des développeurs.

Aucun tarif n'a été communiqué à ce stade, ni sur l'API ni sur les coûts de production. C'est la principale inconnue pour les studios qui envisagent d'industrialiser.

Ce que ça change concrètement

Pour la création de contenu, l'audio natif est le vrai changement. Jusqu'ici, produire une vidéo IA sonorisée demandait un montage en deux temps : génération visuelle d'un côté, voix off IA ou banque sonore de l'autre, puis synchronisation manuelle. Un modèle qui génère les deux ensemble supprime cette étape.

Pour les 20 secondes : c'est encore court pour un format publicitaire complet, mais suffisant pour un plan de coupe, une intro ou une séquence de format vertical. Combiné au chaînage de clips, on entre dans le domaine du montage assisté plutôt que du gadget.

Reste la question du coût et des droits, qui décidera de l'adoption réelle. Notre comparatif des meilleurs outils de création vidéo IA sera mis à jour dès l'ouverture de l'API.

Questions fréquentes

Qu'est-ce que FLUX 3 ? +
FLUX 3 est le modèle multimodal de Black Forest Labs, lancé le 23 juillet 2026. Il est entraîné conjointement sur l'image, la vidéo, l'audio et la prédiction d'action, et génère des clips jusqu'à 20 secondes avec audio natif.
FLUX 3 est-il open source ? +
Pas encore. Le lancement se fait en accès anticipé. Black Forest Labs annonce pour plus tard dans l'année un accès API, des poids privés et une version FLUX 3 Dev à poids ouverts, dans la lignée des générations précédentes.
Combien coûte FLUX 3 ? +
Aucun tarif n'a été communiqué au lancement, ni pour l'API ni pour les coûts de production. C'est l'inconnue principale pour les studios qui envisagent une industrialisation.
Qu'est-ce que FLUX mimic ? +
C'est l'adaptation du backbone vidéo de FLUX 3 à la robotique, développée avec mimic robotics. Le modèle prédit des actions plutôt que des images. Audi teste le système sur des tâches de manipulation robotisée en production.
FLUX 3 génère-t-il vraiment le son ? +
Oui, l'audio est généré nativement avec la vidéo, y compris le dialogue multilingue synchronisé. C'est la principale différence avec les générateurs qui exigent d'ajouter une piste sonore en post-production.
SB
Sofiane Boumedine Fondateur outils-ia.fr

Passionné de tech et d'IA, je teste et compare les meilleurs outils numériques pour vous aider à faire les bons choix. 1200+ sites gérés, 10+ ans de tests.

Voir tous mes articles →