En julio, NVIDIA firmó junto a más de 200 empresas y organizaciones la carta abierta Open Weights and American AI Leadership, cuyo argumento central es que el liderazgo en inteligencia artificial no se medirá por un único modelo frontera, sino por si un ecosistema abierto logra llegar a todos los sectores.
Los modelos abiertos, que cualquiera puede descargar, inspeccionar, modificar y correr sobre su propia infraestructura, son los que hacen posible ese escenario. En ningún terreno resulta tan determinante como en la IA física, donde cada despliegue es, en el fondo, un problema de especialización.
¿Por qué la IA física necesita modelos de mundo?
Un sistema que opera en el mundo real no puede limitarse a reconocer apariencias: tiene que entender y predecir consecuencias. Los modelos de mundo aprenden cómo se comportan los entornos físicos, qué puede ocurrir a continuación y qué acciones tienen sentido después. Con eso generan datos de mundo y de acción con fundamento físico, simulan estados futuros y entregan una base que cada equipo puede especializar para un robot, un vehículo autónomo o un sistema de visión.
El cuello de botella es el dato. Recolectar información de IA física a la escala necesaria es caro y difícil, y los eventos raros o de cola larga resultan especialmente complicados de reproducir de forma segura y repetible. Los modelos de mundo abiertos apuntan a tres cosas concretas:
- Más datos útiles, aprendiendo relaciones físicas desde escenarios multimodales a gran escala.
- Entornos más diversos, con variaciones de clima, iluminación, objetos y trayectorias.
- Una mejor base sobre la cual construir y adaptar a un robot, vehículo, configuración de sensores, tarea o entorno operativo particular.
Un modelo general nunca vio el robot específico de un equipo, ni sus sensores, ni su entorno. Cerrar esa brecha exige tres condiciones simultáneas: acceso a los pesos del modelo, una licencia que permita adaptarlo y las herramientas de post-entrenamiento. Los modelos fundacionales Cosmos están disponibles bajo la licencia OpenMDW 1.1 de la Linux Foundation, lo que habilita post-entrenar sobre datos y hardware propios. Ahí la apertura deja de ser una postura y pasa a ser un requisito técnico.
Especializar el modelo, sin embargo, es solo una parte del flujo. Los equipos también necesitan entornos donde generar datos, correr simulaciones y probar comportamientos. Las librerías de NVIDIA Omniverse, parte del NVIDIA Agent Toolkit, aportan capacidades prearmadas para construir mundos listos para simulación, mientras OpenUSD provee el marco abierto para componer, reutilizar e intercambiar datos 3D complejos entre gemelos digitales, simulaciones y flujos de generación de datos sintéticos.
¿Qué trae exactamente Cosmos 3?
Cosmos 3 es un omni-modelo fundacional abierto construido sobre una arquitectura de mixture-of-transformers. Combina razonamiento visual, generación de mundo y predicción de acciones, de modo que una sola familia de modelos permite entender escenas, generar datos sintéticos, simular estados futuros y construir world action models especializados, en vez de mantener un modelo distinto para cada capacidad.
| Versión | Parámetros | Uso previsto |
|---|---|---|
| Cosmos 3 Super | 64B | Modelado de mundo de alta fidelidad |
| Cosmos 3 Nano | 16B | Razonamiento eficiente y post-entrenamiento |
| Cosmos 3 Edge | 4B | Razonamiento visual en dispositivo y despliegue de políticas de robot |
La versión Edge es lo bastante liviana para correr sobre GPU de borde, y se puede desplegar en GPU NVIDIA RTX, sistemas DGX y plataformas Jetson, incluida Jetson Thor. Esa es la puerta de entrada realista para un laboratorio universitario o una pyme de automatización en Chile: un modelo de 4B parámetros corriendo sobre un Jetson en la planta no depende de conectividad ni de cuota de nube, a diferencia de los 64B de la versión Super, que exigen infraestructura de centro de datos.
En las evaluaciones de referencia, Cosmos 3 aparece en el primer lugar de Artificial Analysis en pesos abiertos para generación texto a imagen e imagen a video, de PAI-Bench en generación de mundo y de la categoría imagen a video de Physics-IQ. En políticas de robot encabeza RoboLab, y Cosmos 3 Super es el modelo abierto mejor rankeado en VANTAGE-Bench para comprensión visual.
Además de Cosmos, el stack de IA física de NVIDIA incluye Isaac GR00T para robótica, Alpamayo para vehículos autónomos y Metropolis para visión.
¿Quién lo está usando en producción?
En robótica aparecen Doosan Robotics, LG Electronics, Samsung Electronics y Skild AI. En vehículos autónomos, Li Auto, Xiaomi y Afari. En agentes de visión, Centific, Fogsphere, Linker Vision, Milestone Systems y Yuan, orientados a aplicaciones industriales y espacios inteligentes.
La Cosmos Coalition extiende ese trabajo reuniendo a constructores de modelos de mundo, desarrolladores e industria para aportar modelos, investigación y métodos de evaluación. NVIDIA amplió la coalición a Japón, donde líderes de robótica y manufactura planean desarrollar modelos de mundo abiertos para fábricas, logística, agricultura, construcción, salud y transporte.
Los detalles completos de arquitectura y evaluaciones están en el informe técnico de Cosmos 3, y la colección de modelos y datasets está publicada en Hugging Face y GitHub.




