Flux 3 - Imagen y sonido en la misma generación

Parte de un texto, una foto, un clip ya grabado o dos fotogramas clave y recibe un plano de hasta 20 segundos con audio nativo opcional.

Planos reales hechos con Flux 3

Cabeceras de canal, piezas de marca, rótulos divulgativos y escenas de ficción breve donde el sonido nació con la imagen, no en el montaje.

Revelación Horizonte Neón

Promoción de marca

Teaser de pastel de cereza

Película de producto

Lanzamiento Cyber City

Promoción de marca

Encuentro en el campo dorado

Promoción cinematográfica

Presentación de heroína de acción

Promoción de entretenimiento

Impacto en tienda de conveniencia

Promoción de marca

Primer plano del casco

Película de producto

Promo de café al atardecer

Promoción lifestyle

Lo que este modelo pone en tus manos

Cuatro capacidades del modelo de Black Forest Labs, contadas por lo que cambian en tu jornada de edición.

Vídeo y audio a la vez

Los diálogos, los efectos y el ruido de fondo salen sincronizados con lo que ocurre en el plano, así que una pieza para Reels llega montada sin pasar por una sesión de doblaje. Cada generación produce como máximo 20 segundos, y el audio es opcional: si tu contenido se consume en silencio, lo dejas fuera.

Cuatro puntos de partida

¿Tienes una foto de producto? Se anima. ¿Un clip a medio grabar? Continúa desde ahí. ¿Solo el primer y el último fotograma de una escena? El movimiento intermedio se genera solo, igual que si arrancas desde una frase escrita. Ese uso de Flux 3 imagen a video es una forma de entrada al vídeo, no una herramienta de retoque fotográfico.

Diálogo y rótulos multilingües

Escribe el prompt en español y el diálogo sale en español, junto con los textos que pidas dentro del encuadre, renderizados con buena precisión en varios idiomas. Conviene copiar literalmente la frase que quieres ver en pantalla, porque el modelo reproduce lo que le das y la ortografía final merece una revisión tuya.

Secuencias de varios planos

Un clip suelto rara vez cuenta una historia, y aquí los fragmentos se encadenan en secuencias multiplano con progresión de escena. El modelo se apoya en su lectura de las expresiones faciales y en la correspondencia entre cada sonido y el hecho físico que lo produce en imagen.

Cómo usar Flux 3 en tres pasos

Del material que ya tienes al archivo listo para publicar, sin salir de VideoAI.

PASO 01

Elige por dónde empiezas

Selecciona el modelo y decide tu material de arranque: una descripción escrita, una foto de producto o de una persona, un clip grabado o el par de fotogramas inicial y final. La foto encaja cuando trabajas para una marca, la continuación de clip resuelve el vídeo de e-commerce que se quedó a medias y los fotogramas clave son el camino natural de la ficción breve. El prompt puedes redactarlo directamente en español.

PASO 02

Describe lo que se ve y lo que se oye

En el mismo prompt cuentas la acción del plano y su banda sonora: las líneas de diálogo copiadas tal cual, el ambiente que quieres escuchar y los rótulos en español que deben aparecer en pantalla, también escritos literalmente para que salgan con buena precisión. Como cada generación llega a 20 segundos, describe un único plano por vez. Si tu pieza se ve en silencio, prescinde del audio y deja que los textos en pantalla carguen con la información.

PASO 03

Genera, encadena y publica

Lanza la generación y revisa el resultado; si necesitas más recorrido narrativo, encadena varios fragmentos en una secuencia de varios planos. Después descargas el vídeo sin marca de agua, listo para usarlo en tu canal o en campañas comerciales, y lo adaptas al formato de YouTube, Shorts, Reels o TikTok.

Explora otros modelos

Explora más modelos de IA para creación de imágenes y videos.

Prueba Flux 3 con una pieza real

Empieza con lo que ya tienes encima de la mesa

Una frase, una foto de producto o dos fotogramas bastan para ver tu primer plano en VideoAI.

Crea tu primer plano

Dudas frecuentes antes de generar

¿Qué es Flux 3 y quién lo ha desarrollado?

Es el modelo multimodal que Black Forest Labs presentó el 23 de julio de 2026, entrenado de forma conjunta sobre imagen, vídeo y audio dentro de una misma arquitectura, a la que llaman Self-Flow. En esta página trabajamos con su generación de vídeo, que es la parte que usas cuando lo eliges en VideoAI.

¿Cómo usar Flux 3 si nunca he generado un vídeo con IA?

Tres pasos bastan: eliges el material de partida (texto, foto, clip o fotogramas clave), escribes en el prompt qué sucede en el plano y qué se oye, y generas. Luego revisas el resultado y, si algo no encaja, ajustas la descripción y vuelves a generar; para piezas más largas, encadenas varios fragmentos.

¿Puedo usar Flux 3 gratis en VideoAI, hace falta cuenta y los vídeos llevan marca de agua?

Al registrarte recibes 10 créditos de bienvenida que ya cubren este modelo, así que tu primera generación no pasa por caja. Sí necesitas iniciar sesión con una cuenta para generar. Lo que descargues sale sin marca de agua y puedes utilizarlo en proyectos comerciales, en tu canal o en las campañas de un cliente. Cuando agotes los créditos, sigues adelante con un paquete de recarga o una suscripción.

¿Cuánto puede durar un vídeo hecho con Flux 3?

Cada generación produce como mucho 20 segundos de vídeo. Para piezas de mayor recorrido, la vía es encadenar varios fragmentos en una secuencia de varios planos; la duración total de esa secuencia no está fijada en una cifra oficial, así que la marcas tú según cuántos planos montes.

¿El audio se genera junto con la imagen o hay que añadirlo después?

Sale a la vez que la imagen: el diálogo, los efectos y el ambiente se generan sincronizados con lo que ocurre en el plano, sin una pasada posterior de sonorización. Y es opcional, de modo que puedes pedir el plano en silencio cuando tu formato lo consume así.

¿Puedo convertir la foto de un producto en un vídeo?

Sí, subes la foto y el modelo la anima o la toma como referencia para el plano. Conviene aclarar que esa entrada alimenta la generación de vídeo: el Flux 3 generador de video parte de tu imagen, pero no crea ni retoca fotografías. Junto a la foto tienes otros tres arranques: texto, un clip ya grabado y un par de fotogramas clave.

¿Los rótulos que pido salen bien escritos dentro del plano?

El modelo renderiza texto dentro del encuadre en varios idiomas con buena precisión, aunque no garantizamos que la ortografía y las tildes salgan perfectas en cada intento. Escribe en el prompt la frase exacta, tal cual quieres verla, y dale un repaso al resultado antes de publicarlo.

¿A qué resolución y en qué formato sale el vídeo?

No damos ninguna cifra de resolución, relación de aspecto ni formato de salida, porque no son datos confirmados y preferimos no inventarlos. Lo que sí sabes es qué recibes: un vídeo con audio nativo opcional, descargable desde tu cuenta de VideoAI para llevarlo al montaje o subirlo directamente.

Flux 3: genera vídeo con audio nativo - VideoAI