[AINews] FLUX 3 de Black Forest Labs: Modelos multimodales que superan a Seedance 2.0, Gemini Omni y Grok Imagine

¡Una gran victoria para BFL!

Los jueves son los días más intensos para los lanzamientos de IA. Aunque OpenAI obtuvo una victoria sobre Anthropic al lanzar el nuevo ChatGPT Voice (consumidor) y OpenAI Presence (empresarial), logrando más impresiones que Claude Voice hoy (una coincidencia de tiempos totalmente accidental, estamos seguros), ninguno parece tan monumental como el lanzamiento de FLUX 3 Video de BFL el día de hoy.

La última vez que cubrimos a BFL fue en nuestro muy bien recibido podcast con Anjney Midha:

La mayoría de los entusiastas de los medios generativos recordarán la página de inicio de BFL cuando lanzaron Flux 1 en 2024, sugiriendo modelos de video para el futuro, con su logo en un bosque. Bueno, dos años después, finalmente es una realidad:

Logo de Black Forest Labs representando la evolución hacia modelos de video
Logo de Black Forest Labs representando la evolución hacia modelos de video

El blog oficial describe "Self Flow", cubriendo TODAS sus modalidades en conjunto con fuertes afirmaciones de preferencia:

Diagrama técnico que explica la arquitectura Self Flow de BFL
Diagrama técnico que explica la arquitectura Self Flow de BFL

"Sus capacidades principales incluyen lo siguiente (todos los resultados incluyen generación de audio nativa):

  • Generación de texto a video.
  • Generación de imagen a video, ya sea continuando desde un fotograma inicial ("animación") o usando imágenes como referencias visuales.
  • Generación de video a video desde un clip de referencia, trasladando elementos centrales de un video fuente —por ejemplo, el mismo personaje— a una nueva escena o contexto.
  • Continuación generativa de video y audio a partir de una entrada de video y audio.
  • Generación de video a partir de fotogramas clave para transiciones controladas entre momentos definidos.
  • Diálogo multilingüe.
  • Una amplia gama de estilos visuales y relaciones de aspecto, extendiéndose mucho más allá de la salida cinematográfica convencional.
  • Encadenamiento agéntico de clips individuales en secuencias más largas de múltiples tomas.
  • Alta diversidad de estilos: FLUX 3 Video maneja fácilmente rangos de estilos desde material de cámara de mano hasta animación y cinemática.
  • Generación de tipografía sólida y diseños animados."

Algunas de las características anteriores son de vanguardia (SOTA) en comparación con otros modelos de laboratorios líderes, como discutimos en nuestro podcast sobre Grok Imagine, por lo que la comunidad ha sido advertida de que ahora existe una reproducción independiente, quizás SOTA, de estas capacidades, con una versión Dev de pesos abiertos en camino.

Estamos anunciando a los oradores de AIEWF esta semana. ¡Responda la Encuesta de Ingeniería de IA!

Como si este lanzamiento no fuera suficiente, el equipo también anunció FLUX3-mimic, lo cual demuestra que el modelo FLUX 3 está aprendiendo un modelo de mundo suficiente capaz de conducir robots...

... y prediciendo su impacto en entornos de fábrica reales...

Representación visual de la integración de FLUX 3 en entornos de robótica industrial
Representación visual de la integración de FLUX 3 en entornos de robótica industrial
Noticias de IA para el 22/07/2026-23/07/2026. Revisamos 12 subreddits, 544 cuentas de Twitter y ningún Discord adicional. El sitio web de AINews le permite buscar todas las ediciones anteriores. Como recordatorio, AINews es ahora una sección de Latent Space. ¡Puede optar por activar o desactivar las frecuencias de correo electrónico!

Resumen de AI Twitter

Código abierto, modelos abiertos y la línea de falla política en torno a la destilación

  • The Stack v3 es el lanzamiento de datos abiertos más importante del día: @anton_lozhkov anunció The Stack v3, ahora el conjunto de datos de código abierto más grande publicado públicamente: 114 TB en bruto, 224 millones de repositorios, 44 mil millones de archivos, 770 lenguajes y aproximadamente 5 billones de tokens deduplicados/filtrados. En relación con la v2, el corpus filtrado salta de ~550 mil millones a ~5 billones de tokens, con ganancias especialmente grandes en C++ (x15), TypeScript (x7.5), Rust (x7) y Python (x4.8). Los cambios operativos notables son que la v3 envía contenidos en línea en lugar de IDs de Software Heritage, incluye un nuevo rastreo de GitHub hasta agosto de 2025, excluye código con licencias restrictivas y ofrece tanto una división lista para entrenar como un bucket completo para deduplicación/filtrado personalizado. Los investigadores de Hugging Face lo enmarcaron explícitamente como infraestructura para la próxima generación de modelos de código abierto y herramientas de defensa cibernética: ver @LoubnaBenAllal1, @lvwerra, y comentarios de @eliebakouch señalando que las versiones anteriores de The Stack se utilizaron en muchas mezclas de entrenamiento de modelos de código divulgadas.
  • La destilación sigue siendo la línea de falla ideológica en vivo: varias publicaciones de alta señal rechazaron los intentos de separar bruscamente el "pre-entrenamiento a escala de internet" de la destilación a nivel de salida. @GergelyOrosz comparó la inspección de modelos mediante prompting con la ingeniería inversa del producto de un competidor, mientras que @SchmidhuberAI enfatizó el largo linaje de la destilación. @Suhail argumentó que la respuesta práctica no es la prohibición, sino una mayor inversión en modelos domésticos de pesos abiertos, y @garrytan lo expresó de manera más simple: los pesos abiertos son estratégicamente importantes. El subtexto en todas estas publicaciones es que los conjuntos de datos abiertos como The Stack v3 elevan materialmente el estándar para cada laboratorio que quiera construir modelos de código competitivos sin depender de ecosistemas cerrados.

Frontera multimodal: FLUX 3, transferencia de robótica y nuevos sistemas de audio/TTS

  • FLUX 3 de Black Forest Labs expande la frontera multimodal más allá de imagen/video: @bfl_ai lanzó FLUX 3, un modelo multimodal unificado que abarca imagen, video, audio y predicción de acciones, con acceso anticipado para FLUX 3 Video y una afirmación explícita de que la misma arquitectura puede extenderse hacia la robótica. Los miembros del equipo lo conectaron con la investigación anterior de Self-Flow, incluyendo a @hila_chefer y @robrombach. Lo que importa técnicamente es la historia del entrenamiento unificado: no es una familia dispersa de generadores especializados, sino una arquitectura destinada a cerrar la brecha entre la generación de medios y el control.
  • FLUX-mimic de mimic es una instanciación robótica concreta de esa tesis: @mimicrobotics describió FLUX-mimic como un Modelo de Video-Acción construido sobre FLUX 3, entrenado con datos de robots y dispositivos portátiles para destreza de propósito general y desplegable en una GPU local única. Su afirmación central es que un mejor modelado del mundo en video se transfiere directamente a la calidad del control del robot y a la eficiencia de la muestra; ya están realizando pruebas con Audi. Esto encaja con @GeneralistAI, cuyo GEN-1 ahora admite varios efectores finales y puede adaptarse cuando la "mano" cambia a mitad de la ejecución, reforzando la idea de que las políticas de encarnación general pueden provenir del condicionamiento sobre la morfología en lugar de la especialización por manipulador.
  • El audio vio dos lanzamientos notables...

Vía Latent Space.