MirroS liberó Code-as-World, un paradigma que representa mundos físicos mediante representaciones ejecutables. El argumento es acotado y comprobable: los píxeles son evidencia de una escena física, no su ontología. Un modelo de video puede predecir cuadros plausibles sin representar jamás la masa, el contacto o la gravedad. Por eso, en vez de píxeles, vectores latentes o descripciones de texto, Code-as-World representa una escena como código ejecutable, un scene.json que MuJoCo puede correr, que un agente puede verificar contra el video de origen y que cualquiera puede editar y volver a simular.
Un bucle de agentes recupera esos programas desde material filmado real en hasta cinco rondas. Los mundos verificados se convierten después en datos de entrenamiento con etiquetas físicas exactas, algo que el video real no trae. Entrenado con esa supervisión, Code-as-World-VL-9B obtiene 55,4 MRA en la validación de QuantiPhy, por encima de Gemini 3.1 Flash con 54,8 y unos 15 puntos sobre la mejor referencia de pesos abiertos.
¿Se puede usar hoy?

Sí, en el nivel de investigación y prototipo interno. MirroS publicó el repositorio de GitHub y dos puntos de control, Code-as-World-VL-4B y Code-as-World-VL-9B, bajo licencia Apache 2.0, ajustados desde Qwen3.5-4B y Qwen3.5-9B. Ambos vienen como safetensors en BF16, servidos por vLLM detrás de un endpoint compatible con OpenAI en /v1, con 16 cuadros muestreados por video y --max-model-len 4608.
La idea: los píxeles son evidencia, no ontología
El informe técnico de MirroS sostiene que los modelos de video, la reconstrucción 3D y las descripciones textuales recuperan cada uno una parte de la escena, pero ninguno recupera su mecanismo. Code-as-World representa una escena como una representación ejecutable del mundo (EWR, por su sigla en inglés), una tripleta p = (C, E, A):
- Composición: objetos, geometría, dimensiones métricas, masa, fricción, gravedad. Los pisos y las paredes son entidades físicas estáticas, de modo que pueden sostener y colisionar.
- Evolución: estados iniciales, fuerzas, contactos, colisiones, condiciones de término, duración. Al ejecutarla, la composición se expande en una trayectoria de estados completa.
- Apariencia: cámara, iluminación, materiales, fondo, tasa de cuadros, configuración de renderizado. Cambiarla nunca altera la física.
En la implementación liberada, esa tripleta se compila en un scene.json que se ejecuta en MuJoCo, con dos motores intercambiables: uno de animación, que usa poses cinemáticas, y uno de física, que usa fuerzas y contactos.
Descubrimiento por agentes en vez de predicción en un solo paso
Recuperar una EWR desde un video es un problema inverso, así que el equipo lo plantea como búsqueda abductiva. Un agente ejecuta el ciclo proponer, instanciar, ejecutar, renderizar y verificar durante hasta K = 5 rondas. Para la entrada de video, SAM 3 aporta las máscaras de instancia y las trayectorias en el plano de imagen, VGGT-Omega estima profundidad y geometría de cámara, y SAM 3D genera mallas por objeto.
Las simulaciones candidatas se proyectan de vuelta a la vista de entrada y se comparan en cuadros clave sobre RGB, profundidad, máscaras y trayectorias. Las discrepancias por cuadro se agregan en una retroalimentación estructurada que guía la siguiente revisión, y cuando el presupuesto se agota sin aceptación, la hipótesis se descarta.
Con un presupuesto equivalente de cinco evaluaciones, el bucle supera al muestreo independiente Best-of-5 en alineamiento visual, IoU de objetos, Traj-ADE y Accuracy@2%D, y el resultado se repite con el segundo motor de ejecución. Los videos candidatos vienen de WISA-80K tras un filtrado orientado al movimiento.
Mundos verificados como supervisión de entrenamiento
La primera fase es un ajuste supervisado sobre 73.335 pares de preguntas y respuestas en el espacio de la imagen, construidos a partir de RefCOCO/+/g, RefCLEF y GOT-10K, que cubren extensión, posición, desplazamiento, velocidad y aceleración en píxeles crudos. La segunda fase aplica GRPO a preguntas en el espacio del mundo, extraídas de 1.585 mundos ejecutables generados desde texto y 988 generados desde video, con recompensa por precisión numérica normalizada por escala más términos de unidad y formato. El entrenamiento usó ocho GPU NVIDIA H100.
En la validación de QuantiPhy, de 159 ítems con MRA promediado sobre 2S/2D/3S/3D, los resultados son 4B = 50,6, 9B = 55,4 y 27B con razonamiento = 58,6, frente a Gemini 3.1 Flash con 54,8, ChatGPT 5.1 con 48,4 y la mejor referencia de pesos abiertos, Qwen3-VL-32B-Instruct, con 40,2.
La ablación entrega el número más útil: la versión entrenada solo en el espacio de la imagen obtiene 44,2 en el modelo de 4B y 50,9 en el de 9B; al sumar ambas fuentes de espacio del mundo, sube a 50,6 y 55,4. El anclaje a nivel de píxel también mejora: el modelo de 9B pasa de 63,7 a 68,3 en RefCOCO y de 20,1 a 26,6 en GOT-10K después del aprendizaje por refuerzo en el espacio del mundo.
Conclusiones principales
- Code-as-World transforma un video en un
scene.jsoneditable que MuJoCo puede ejecutar y verificar. - La búsqueda de cinco rondas de proponer y verificar supera al muestreo Best-of-5 con el mismo presupuesto de cómputo.
- Los mundos verificados aportan etiquetas físicas exactas que el video real sencillamente no lleva.
- El modelo de 9B alcanza 55,4 MRA en QuantiPhy, sobre los 54,8 de Gemini 3.1 Flash, y tanto el de 4B como el de 9B son Apache 2.0.
- La limitación está a la vista: solo cuerpos rígidos, y el modelo nunca aprende el bucle de descubrimiento en sí.
¿Qué implica para quien trabaja con robots?
Vale la pena traducir estas cifras a hardware. El modelo de 4B, con 50,6 MRA, queda a 4,2 puntos del de 9B y a 4,2 de Gemini 3.1 Flash: es el que cabe en una estación de trabajo con una sola GPU de 24 GB, no en las ocho H100 que exigió el entrenamiento. Para un laboratorio latinoamericano que ya usa MuJoCo, ese es el punto de entrada realista, porque el costo alto está en generar los mundos verificados, no en consultarlos después.




