La empresa alemana Black Forest Labs (BFL) lanzó Flux 3, un modelo fundacional multimodal que aprende de imágenes, video y audio de forma conjunta. En las primeras pruebas de la propia compañía, superó a varios rivales en generación de video.
BFL describe a Flux 3 como un paso hacia la "inteligencia visual del mundo real", que define como modelos capaces de "percibir, predecir y actuar en entornos físicos y digitales". La empresa forma parte de un movimiento más amplio hacia los llamados world models o modelos de mundo.
Ninguna modalidad captura la realidad por completo, argumenta BFL. Las imágenes muestran la estructura espacial, el video registra cómo cambia con el tiempo y el audio revela vínculos entre eventos mecánicos y los sonidos que producen. Entrenar con las tres a la vez permite que se completen entre sí y entrega al modelo más información que aprender cada modalidad por separado.
¿Qué puede hacer Flux 3 con video y audio?
Por primera vez, Flux 3 genera videos con audio nativo, con clips de hasta 20 segundos. Admite texto a video, imagen a video, video a video, transiciones basadas en fotogramas clave, diálogo multilingüe y encadenamiento de clips guiado por agentes para armar secuencias más largas de varias tomas. Según BFL, el modelo es especialmente bueno con las expresiones faciales humanas y con hacer coincidir los sonidos con los eventos físicos.
¿Qué tan bueno es frente a la competencia?
En evaluaciones iniciales con clips de 10 segundos a 720p, BFL reporta que Flux 3 fue preferido sobre Luma Ray 3.2 en el 93% de las comparaciones, sobre Runway Gen-4.5 en el 77% y sobre Grok Imagine Video en el 69%. Los márgenes se estrechan contra rivales más fuertes: Flux 3 fue preferido sobre Kling v3 Pro el 60% de las veces, sobre Happy Horse v1 el 59%, sobre Happy Horse 1.1 el 57%, y quedó empatado en el 52% tanto con Seedance 2.0 como con Gemini Omni Flash.
BFL aclara que los resultados son preliminares y que aún no hay pruebas independientes. Igualar a sistemas líderes como Seedance, que ya llegó a Hollywood, y Gemini Omni Flash ubicaría a Flux 3 entre los mejores modelos de video.
¿Y las aplicaciones en robótica?
La compañía también espera que Flux 3 mejore la generación de imágenes, sobre todo en prompts complejos y en el renderizado preciso de texto en varios idiomas. BFL planea liberar Flux 3 Image en acceso anticipado dentro de las próximas semanas.
BFL sostiene que el modelo puede además predecir acciones a partir de su comprensión del mundo. Junto a Mimic Robotics desarrolló Flux-mimic, un modelo de video y acción que ya se prueba en tareas de producción en Audi.
Flux 3 se basa en Self-Flow, el enfoque de BFL para enseñar a un mismo modelo a generar y a comprender contenido al mismo tiempo. Un transformador multimodal usa componentes dedicados para convertir imágenes, video y audio en una representación interna compartida y luego devolverlos como salidas. Un componente para acciones aporta la base de las aplicaciones robóticas.
Despliegue por fases y pesos abiertos
BFL lanza todas las capacidades de forma escalonada, con fases de acceso anticipado para recoger comentarios y hacer pruebas de seguridad. Flux 3 Video ya está disponible y Flux 3 Image llegará en las próximas semanas. La predicción de acciones se ofrecerá al principio a través de socios seleccionados.
La empresa también planea liberar acceso de pesos abiertos al núcleo multimodal bajo el nombre Flux 3 Dev. A más largo plazo, trabaja en modelos de próxima generación que buscan combinar percepción, acción y predicción de lenguaje en un único sistema.




