
IA de vídeo: China domina el mercado frente a EE. UU.
Mientras OpenAI y Anthropic dominan en texto y código, la industria china se ha hecho con el control absoluto de la generación de vídeo y los modelos físicos.
6 notas publicadas

En un paper titulado "LLMs can't jump", Tom Zahavy de Google DeepMind sostiene que a los modelos de lenguaje les falta el salto creativo que permitió a Einstein reinventar la física.

Black Forest Labs presenta un modelo multimodal que aprende de imágenes, video y audio, y que la empresa alemana ya prueba en robótica junto a Audi.

La empresa australiana Contactile propone VμA, una clase de modelos que suma el coeficiente de fricción como entrada directa para que los robots manipulen objetos sin fallar.

La Academia de IA de Pekín entrenó Orca con 125.000 horas de video sin una sola etiqueta de acción y aun así iguala al sistema especializado π0.5 en cinco tareas de robótica.

El nuevo modelo guarda los rasgos de la escena en el espacio latente del difusor, recorta hasta 55x la memoria gráfica y deja esquinas y muebles fijos cuando la cámara vuelve.
Otros temas que aparecen junto a #world models en nuestra cobertura editorial.