Ilustración conceptual del modelo multimodal FLUX 3 de Black Forest Labs generando video, audio, imagen y acciones robóticas
Volver al blog
IA 25 Julio 2026 16 min lectura 16 visitas

FLUX 3 de Black Forest Labs: el modelo multimodal alemán que planta cara a Sora 2 y Veo 3 (julio 2026)

Arkaia
Arkaia Editor

FLUX 3 es el modelo multimodal que Black Forest Labs presentó el 23 de julio de 2026 y con el que la casa alemana se planta oficialmente en la pelea que hasta ahora libraban OpenAI Sora 2, Google Veo 3 y Kling 3. Video con audio nativo hasta 20 segundos, imagen fotorrealista, edición, tipografía legible y hasta predicción de acciones para robots industriales. Todo desde un único conjunto de pesos entrenado de forma conjunta. Y todo en una empresa europea que hasta ayer se conocía solo por sus generadores de imagen.

La jugada es agresiva, con anuncios importantes en el mismo comunicado: FLUX 3 Video ya está en early access con partners seleccionados, FLUX 3 Image llega en las próximas semanas, FLUX 3 Action se está probando en cadenas de montaje reales de Audi con mimic robotics, y una versión open-weight (FLUX 3 Dev) está prometida para más adelante en 2026. En Arkaia hemos leído el whitepaper, revisado las demos oficiales, cotejado la letra pequeña de la comparativa que publicó BFL y montado esta guía en profundidad para responder a la única pregunta que importa: ¿estamos ante el nuevo rey del video generativo o ante otro anuncio bonito que llega tarde?

Ilustración conceptual del modelo multimodal FLUX 3 de Black Forest Labs generando video, audio, imagen y acciones robóticas
FLUX 3 unifica video, imagen, audio y predicción de acciones robóticas en una sola arquitectura entrenada de forma conjunta.

Qué es FLUX 3: la primera arquitectura nativamente multimodal de BFL

Hasta ahora, Black Forest Labs era conocido por FLUX.1 y FLUX.2, dos familias de modelos de difusión centrados exclusivamente en imagen estática que se usaban en productos como Grok Imagine, Freepik o ComfyUI. Con FLUX 3, la empresa que fundaron los antiguos investigadores de Stable Diffusion abandona la especialización única y salta a lo que ellos mismos llaman una arquitectura nativamente multimodal: imagen, video, audio y acción son ahora modalidades de un mismo modelo, no productos separados con pesos distintos.

El comunicado oficial habla de un enfoque interno llamado Self-Flow, que alinea la generación y la comprensión multimodal dentro del mismo sistema. En cristiano: el modelo no aprende a hacer video por un lado, sonido por otro y planificación motora por otro. Aprende a razonar sobre pixeles, formas de onda y secuencias temporales de forma conjunta, y luego usa cabezales de salida específicos para cada modalidad. Esta unificación es la que permite que un mismo prompt genere un clip con diálogo sincronizado, o que la propia representación interna sirva para pilotar un brazo robótico.

BFL no ha publicado aún el número exacto de parámetros ni ha confirmado si la arquitectura es un Diffusion Transformer (DiT) puro o un híbrido con Mixture of Experts, pero sí ha dejado claro que la familia FLUX 3 será modular por diseño y que las versiones API y open-weight compartirán backbone.

Los 4 módulos de la familia FLUX 3: Video, Image, Action y Dev

El anuncio del 23 de julio no es un producto único: es un roadmap con cuatro piezas que se irán activando durante el resto del año. Conviene entender qué llega ahora y qué llega después, porque el ruido mediático mezcla capacidades disponibles con promesas futuras.

  • FLUX 3 Video: disponible en early access desde el 23 de julio de 2026 a través de la web de BFL y de partners API seleccionados. Es la pieza estrella, con generación de clips de hasta 20 segundos con audio nativo.
  • FLUX 3 Image: rollout previsto en las semanas siguientes al lanzamiento. Toma el testigo de FLUX.2 pero comparte pesos con la parte de video, lo que en teoría debería traducirse en mejor coherencia física, tipografía renderizada correctamente y edición local mucho más limpia.
  • FLUX 3 Action: la sorpresa del anuncio. Predicción de acciones para robótica, en early access con partners como mimic robotics. No es un producto para el usuario final, sino un módulo B2B/industrial.
  • FLUX 3 Dev: la versión open-weight, prometida para más adelante en 2026. Sin fecha, sin licencia definitiva y sin especificaciones publicadas. Es la carta con la que BFL intenta mantener la lealtad de la comunidad open source que hizo grande a FLUX.1 Dev y Schnell.

Hay un módulo que oficialmente no existe pero que se intuye: la parte de action-language que traduce texto a instrucciones motoras. Es la capa que hace que FLUX-mimic funcione, pero BFL no la vende como producto separado. Por ahora.

Escena de generación de vídeo por FLUX 3 con audio nativo sincronizado y personajes con diálogo
FLUX 3 Video produce clips de hasta 20 segundos con diálogo, efectos y música ambiental generados en la misma pasada, sin post-producción.

FLUX 3 Video en detalle: 20 segundos, audio nativo y multi-shot chaining

Es aquí donde el modelo hace lo que ningún competidor ha hecho antes de la misma forma. Sora 2 genera audio, sí, pero lo hace por pasadas separadas. Veo 3 introdujo audio nativo, pero con clips más cortos. FLUX 3 Video es el primer modelo grande donde el audio se genera dentro del mismo forward pass que el video: diálogo con labios sincronizados, efectos de sala que reaccionan al movimiento de la cámara y música de fondo con el tempo de la escena, todo en una sola operación.

Las especificaciones técnicas que BFL ha filtrado hasta el 24 de julio son las siguientes:

  • Duración: hasta 20 segundos en una sola generación (frente a los 8-10 segundos habituales en Sora 2 base o Veo 3.1 fast).
  • Resolución: 720p en early access, con planes de 1080p y 4K en las próximas iteraciones.
  • Cinco modos de entrada: texto a video, imagen a video, video a video con character carry-over, video más audio de referencia, y modo keyframe transitions para animar entre dos imágenes fijas.
  • Audio multilingüe: los personajes pueden hablar idiomas distintos dentro del mismo clip, con lip-sync generado a la vez que la imagen.
  • Multi-shot chaining: los clips de 20 segundos pueden encadenarse en secuencias de minutos manteniendo coherencia de personajes, iluminación y encuadre.
  • Tipografía legible: FLUX 3 renderiza texto dentro del vídeo sin la típica papilla de píxeles que arrastraban los modelos de la generación anterior.

Este último punto es más importante de lo que parece. Para ad-makers, tráilers y contenido de marca, el hecho de que un modelo escriba correctamente el nombre del producto o el call to action elimina una fase entera de retoque en After Effects.

Comparativa FLUX 3 vs Sora 2, Veo 3, Runway Gen-4 y Kling 3

BFL publicó junto al anuncio una evaluación de preferencias humanas comparando FLUX 3 con la competencia sobre clips de 10 segundos a 720p. Los datos son de la propia BFL, así que hay que leerlos con cautela (el método completo no se ha auditado), pero dan una foto muy clara del posicionamiento del modelo:

Modelo Audio nativo Duración máx. Precio orientativo Preferencia vs FLUX 3 Origen
FLUX 3 Video Sí, sincronizado 20 s Sin publicar Referencia Alemania (BFL)
OpenAI Sora 2 Sí, pasada aparte 10-15 s ~$0.75/s N/D en el paper EE. UU.
Google Veo 3.1 Sí, nativo 8-10 s Desde $0.15/s N/D en el paper EE. UU.
Runway Gen-4.5 No nativo 10 s Créditos 77 % a favor de FLUX 3 EE. UU.
Kling v3 Pro Parcial 10 s ~$0.10/s 60 % a favor de FLUX 3 China (Kuaishou)
Luma Ray 3.2 No nativo 10 s Suscripción 93 % a favor de FLUX 3 EE. UU.
Grok Imagine Video 8 s Incluido X Premium+ 69 % a favor de FLUX 3 EE. UU. (xAI)

Los datos que BFL no incluyó son igual de reveladores. No hay comparativa directa contra Sora 2 ni contra Veo 3.1, precisamente los dos modelos que hoy dominan el podio comercial. La lectura maliciosa: BFL sabe que Sora 2 tiene mejor prompt adherence en escenas complejas y que Veo 3.1 tiene mejor coherencia física en cámaras largas. La lectura amable: los tres modelos ganan en dominios distintos y BFL ha preferido compararse con los que puede batir con claridad.

En cualquier caso, quedarse con Runway, Luma y Kling como rivales oficiales dice mucho del segmento al que apunta FLUX 3: creadores profesionales que hoy pagan a Runway o Kling porque Sora 2 sigue siendo un jardín cerrado y Veo 3.1 vive dentro del ecosistema Google.

Diagrama abstracto de arquitectura multimodal con capas convergiendo en un núcleo único de generación
Arquitectura Self-Flow: video, imagen, audio y acción comparten un backbone unificado con cabezales de salida por modalidad.

Casos de uso reales: ad-makers, cineastas y fábricas alemanas

Uno de los aciertos del lanzamiento es que BFL no se ha quedado en el video de marketing con robots caminando por un desierto. Ha mostrado casos de uso concretos con dos verticales muy distintas.

Publicidad y contenido de marca

Las agencias publicitarias son el primer objetivo comercial. Un spot de 20 segundos con música, voz en off multilingüe y producto renderizado con tipografía correcta cabe entero dentro de una sola generación de FLUX 3 Video. Eso significa iteraciones de creativo pasar de horas a minutos, y presentaciones a cliente en las que se enseñan diez variantes en vez de una. Ya hay estudios en Berlín, Zúrich y Barcelona usando el early access para prototipar campañas antes de rodar.

Cineastas independientes y series cortas

El multi-shot chaining con character carry-over es lo que hace posible pensar en piezas de 3-5 minutos hechas íntegramente con FLUX 3. No sustituye a una producción real, pero para pilotos, animatics profesionales y contenido de nicho (documentales de arqueología, videoensayos, contenido educativo) reduce drásticamente el presupuesto.

Robótica industrial: la sorpresa Audi

El caso más comentado es FLUX-mimic, desarrollado con mimic robotics (Zúrich). Combina el backbone de FLUX 3 con un decoder ligero que traduce la representación interna del modelo (cómo se mueven las cosas en el mundo) en instrucciones motoras concretas. Audi lo está probando en tareas de ensamblaje flexibles, como colocar juntas de puerta, un trabajo que la automatización tradicional no había resuelto. Los datos son impresionantes: 30 minutos de demostraciones humanas frente a las más de 30 horas habituales, y una latencia de reacción de unos 101 milisegundos. Es la primera vez que un modelo generativo de video demuestra utilidad directa en una cadena de producción real.

Brazo robótico industrial ensamblando piezas guiado por un modelo generativo tipo FLUX-mimic en cadena de producción
FLUX-mimic aplica el backbone de FLUX 3 a tareas de ensamblaje flexible en la línea de montaje de Audi, con solo 30 minutos de demostración por tarea.

Cómo entrar en el early access y qué partners lo tienen ya

El acceso a FLUX 3 Video pasa hoy por un único canal: el formulario de Early Access en bfl.ai/models/flux-3. Cualquiera puede solicitarlo, pero BFL revisa caso a caso y prioriza estudios de producción, agencias con contratos activos, laboratorios de investigación y partners robóticos. No hay lista de espera pública ni pricing anunciado.

Los partners iniciales confirmados en el comunicado y en la documentación disponible son:

  • mimic robotics (Zúrich): módulo Action, desplegado en Audi.
  • Audi: cliente industrial del pipeline FLUX-mimic.
  • Freepik y Krea: plataformas de generación creativa que ya integraban FLUX.2 y que serán las primeras en exponer FLUX 3 Image cuando salga.
  • Kie.ai, fal.ai y Replicate: agregadores de APIs que darán acceso a través de sus endpoints una vez BFL abra el canal comercial.
  • ComfyUI: la comunidad open source espera nodos oficiales cuando llegue FLUX 3 Dev.

Precio esperado y disponibilidad general

Aquí es donde la falta de datos duele. BFL no ha publicado precio por segundo, ni por generación, ni sistema de créditos. Podemos, sin embargo, hacer una estimación por triangulación con los precios de la competencia y con lo que la propia BFL cobra hoy por FLUX.2 vía API.

Sora 2 se sitúa en el rango premium con $0.75 por segundo generado. Veo 3.1 arranca desde $0.15/s en modo fast y sube según calidad. Kling 3 Pro se mueve en torno a $0.10/s. Runway Gen-4.5 utiliza un sistema de créditos que equivale, aproximadamente, a $0.20-0.40/s dependiendo del plan.

Con estos referentes y sabiendo que FLUX 3 Video genera clips de 20 segundos con audio en una sola pasada, la estimación razonable es un precio de entre $0.15 y $0.30 por segundo en el API general, con la posibilidad de que exista un tier premium más caro para 1080p y 4K cuando lleguen. Un clip de 20 segundos costaría, por tanto, entre $3 y $6, competitivo con Runway pero más caro que Kling.

El calendario tentativo que se deduce de los comunicados oficiales es el siguiente:

  • Julio 2026 (ahora): early access FLUX 3 Video y FLUX 3 Action con partners seleccionados.
  • Agosto-septiembre 2026: rollout de FLUX 3 Image; API pública para Video con pricing.
  • Q4 2026: lanzamiento previsto de FLUX 3 Dev (versión open-weight) sin licencia confirmada.
  • 2027: general availability con 1080p, 4K y clips de más de 30 segundos.

FLUX 3 Dev: la promesa open-weight para desarrolladores

La comunidad open source hizo grande a Black Forest Labs con FLUX.1 Dev y FLUX.1 Schnell. Miles de nodos de ComfyUI, checkpoints en Hugging Face y proyectos derivados nacieron gracias a esos pesos abiertos. La duda ahora es si FLUX 3 Dev mantendrá ese espíritu o si BFL, presionado por los costes de entrenar un multimodal a esta escala, apretará la licencia.

Las señales son mixtas. Por un lado, el CEO Robin Rombach ha reiterado que la apuesta open-weight sigue siendo parte del ADN de la casa. Por otro, el propio comunicado admite que la versión Dev llegará más adelante en 2026 sin fecha, sin licencia y sin confirmar qué modalidades incluirá. Es perfectamente posible que FLUX 3 Dev sea solo Image, dejando Video y Action como productos exclusivamente API.

Para el ecosistema local de inferencia (Ollama, ComfyUI, Draw Things, Krita) esto es crítico. Si FLUX 3 Dev incluye la parte de video aunque sea con clips cortos, cualquier workstation con una RTX 5090 de 32 GB GDDR7 tipo ASUS ROG Astral podrá generar clips locales sin API ni suscripciones. Si se queda solo en imagen, la comunidad se quedará con ganas y buscará alternativas chinas (Wan 2.7, HunyuanVideo).

Puesto de trabajo de desarrollador multimodal con portátil premium, monitor 4K, auriculares de estudio y micrófono profesional
Un puesto de trabajo bien montado marca la diferencia al iterar prompts, revisar audio nativo y editar clips generativos.

Workstation ideal para trabajar con FLUX 3 y video generativo

Mientras esperamos la versión open-weight y para quienes ya trabajan con Sora 2, Veo 3, Runway o los futuros endpoints de FLUX 3, la pregunta que llega a redacción todas las semanas es la misma: qué equipo necesito para editar, revisar y publicar video generativo de forma profesional. La generación en sí ocurre en la nube (o en la GPU local si es open source), pero el flujo de trabajo alrededor exige memoria, pantalla, sonido y captura serios.

Portátil de referencia para dev multimodal

Para quien prioriza portabilidad, el MacBook Pro M4 Max con 36 GB de memoria unificada y pantalla Liquid Retina XDR sigue siendo la máquina más equilibrada para editar clips generativos, correr modelos locales de tamaño medio y hacer color grading sin sudar. El M4 Max ejecuta modelos como FLUX.2 y Wan 2.7 sin problema y su pantalla es referencia para revisar detalle en HDR.

Mini PC potente para segundo puesto

Como equipo de apoyo o para un editor freelance con presupuesto ajustado, un Beelink SER8 con Ryzen 7 8845HS, 32 GB DDR5 y salida USB4 cabe en cualquier mesa y mueve edición 4K sin sudar. Para tareas de IA local con modelos pequeños, la gráfica integrada Radeon 780M ya da juego.

GPU para inferencia local seria

Si el objetivo es correr FLUX 3 Dev (cuando salga) en local con clips de video reales, la única opción es una ASUS ROG Astral NVIDIA GeForce RTX 5090 de 32 GB GDDR7 o superior. Los 32 GB de VRAM son el mínimo para cargar backbones multimodales del tamaño que se estima para FLUX 3, y la arquitectura Blackwell mejora sustancialmente el rendimiento en atención escalada y en cuantización int4/int8.

Monitor 4K para revisión de color

El LG 32UR500K-B Ultrafine 32 pulgadas 4K UHD con HDR10 es una opción muy sólida en calidad-precio. 3840×2160 nativos, ancho de gama suficiente para grading de trabajo y modo lectura para las horas largas de prompt-engineering. Existen alternativas más caras con Mini-LED, pero para revisión editorial este entra sobrado.

Auriculares monitor con cable

El audio nativo es la característica estrella de FLUX 3 Video, así que revisarlo mal significa publicar mal. Los Sony MDR-7506 con reducción de ruido cerrada siguen siendo el estándar de la industria: respuesta plana, aislamiento sin interferencia y precio muy razonable para un producto profesional que llega desde hace décadas.

Micrófono para grabar prompts y guiones

Para dictado, podcast, grabaciones de referencia para clones de voz y demos, un Blue Yeti USB con 3 cápsulas de condensador y 4 patrones polares es plug and play y da resultados profesionales sin tocar interfaz externa.

Webcam 4K para talking heads

Cuando se combinan clips generados con FLUX 3 Video y tomas reales de presentador, la Logitech BRIO 4K Ultra HD con cancelación de ruido es la referencia. Compatible con Zoom, Teams y OBS, con corrección automática de luz que evita que la calidad de la imagen real cante frente al vídeo generativo.

Silla ergonómica para las jornadas largas

La generación por lotes exige presencia constante durante horas. Una SIHOO Doro C300 ergonómica con reposabrazos 3D y soporte lumbar dinámico es una compra racional: buena mecánica, precio contenido y garantía suficiente para justificarla como material de oficina.

Libro de referencia para entender la teoría

Para quien quiera entender cómo funciona un modelo multimodal como FLUX 3 desde dentro, la referencia canónica sigue siendo Generative Deep Learning (2ª edición) de David Foster. Cubre VAEs, GANs, transformers, flujos normalizantes, modelos de energía y difusión, todo con código y ejemplos prácticos.

Si necesitas más contexto sobre el hardware disponible para IA local, en Arkaia tenemos guías dedicadas a monitores portátiles y análisis de la crisis de precios de RAM y SSD de 2026 que conviene leer antes de configurar la máquina.

Comparativa visual de modelos de generación de vídeo por IA en 2026 mostrando fotogramas de distintos sistemas
Segmentación del mercado en julio de 2026: FLUX 3 apunta al hueco entre Sora 2 (premium) y Kling 3 (volumen).

Preguntas frecuentes (FAQ)

¿Cuándo estará disponible FLUX 3 para el público general?

BFL no ha publicado fecha exacta, pero el rollout se ha estructurado en fases. FLUX 3 Video está en early access desde el 23 de julio de 2026. FLUX 3 Image llegará en las semanas siguientes. La disponibilidad general con pricing público se espera para agosto o septiembre de 2026.

¿Cuánto cuesta generar un vídeo con FLUX 3?

No hay pricing oficial todavía. Por triangulación con Sora 2 ($0.75/s), Veo 3.1 (desde $0.15/s) y Kling 3 Pro (~$0.10/s), la estimación razonable para el API público de FLUX 3 Video se sitúa entre 0.15 y 0.30 dólares por segundo generado, lo que dejaría un clip de 20 segundos entre 3 y 6 dólares.

¿FLUX 3 supera a Sora 2 y Veo 3?

Depende del criterio. En la evaluación publicada por BFL, FLUX 3 gana con claridad frente a Runway Gen-4.5, Kling 3 Pro, Luma Ray 3.2 y Grok Imagine, pero la comparativa oficial no incluye Sora 2 ni Veo 3.1. Su ventaja diferencial es el audio nativo generado en la misma pasada y clips de hasta 20 segundos.

¿Habrá una versión open-weight que pueda ejecutar en local?

Sí, BFL ha confirmado FLUX 3 Dev para más adelante en 2026, sin fecha exacta. No se ha aclarado si incluirá la parte de vídeo o solo imagen, ni bajo qué licencia. Para inferencia local seria se recomienda al menos 32 GB de VRAM (RTX 5090 o superior).

¿Qué es FLUX 3 Action y en qué se diferencia del vídeo?

FLUX 3 Action es el módulo de predicción de acciones para robótica. Usa el mismo backbone del modelo de vídeo pero con un decoder motor que traduce cómo se mueven las cosas en el mundo generado a instrucciones para brazos robóticos. Ya se prueba con mimic robotics en cadenas de montaje de Audi.

¿FLUX 3 puede generar audio y diálogo multilingüe dentro del mismo clip?

Sí, ese es uno de los diferenciadores. Los personajes pueden hablar idiomas distintos en la misma escena, con lip-sync sincronizado y efectos de sala generados junto al vídeo. No es post-producción: sale todo de la misma pasada del modelo.

¿Es Black Forest Labs una empresa europea?

Sí, Black Forest Labs tiene sede en Alemania y fue fundada por investigadores que participaron en el desarrollo de Stable Diffusion. Es hoy la principal alternativa europea en modelos generativos frente a la hegemonía de OpenAI, Google, Meta y las casas chinas como Kuaishou o Alibaba.

¿Puedo integrar FLUX 3 en mi pipeline actual de Runway o ComfyUI?

Con Runway todavía no, porque son competidores directos. En ComfyUI se esperan nodos oficiales cuando salga FLUX 3 Dev. Agregadores como fal.ai, Replicate y kie.ai serán previsiblemente los primeros en ofrecer FLUX 3 Video vía API tras el early access.

Conclusión: BFL entra en la pelea con carta técnica sólida y letra pequeña abierta

FLUX 3 es, sin exagerar, el anuncio más importante de generación de vídeo de este verano. No porque supere en todo a Sora 2 o Veo 3, cosa que la propia BFL no se atreve a afirmar en su whitepaper, sino porque redefine el rango de lo que un solo modelo puede hacer: vídeo con audio nativo hasta 20 segundos, imagen fotorrealista con tipografía correcta, edición local coherente y hasta predicción motora para robótica industrial. Todo desde un único conjunto de pesos entrenado de forma conjunta. Es un salto arquitectónico, no solo un salto de calidad.

La letra pequeña sigue abierta y conviene no perderla de vista: no hay pricing público, no hay benchmarks contra los dos rivales más fuertes, la versión open-weight no tiene fecha ni licencia, y el early access sigue siendo un jardín cerrado. Aun así, tener a una empresa europea entregando este nivel de trabajo en 2026 es una noticia relevante para el ecosistema, y el partnership con Audi vía mimic robotics apunta a que BFL no quiere ser solo un rival de Sora, sino un actor en la próxima ola de robótica de propósito general. Habrá que estar atentos a agosto y septiembre, cuando el modelo abra pricing y la comunidad open source pueda por fin auditar los resultados.

Este artículo contiene enlaces afiliados a Amazon con el tag webmasteroson-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...