World Labs, cofundada por la investigadora de inteligencia artificial Fei-Fei Li, anunció Atlas, un modelo de mundo que genera, reconstruye y simula escenas tridimensionales a partir de apenas unas pocas imágenes. La empresa afirma que supera a los modelos especializados en sus propias tareas, algo que podría volver innecesarios a varios de ellos.
Desde su fundación, World Labs persigue el objetivo de la "inteligencia espacial", la idea de que la IA debería entender el espacio 3D como lo hacen las personas. Atlas es el primer modelo de la compañía construido para hacerlo a escala. En vez de producir imágenes planas o clips de video, capta cómo se ve una escena desde cualquier ángulo y cómo cambia con el tiempo.
¿Qué diferencia a Atlas de un modelo de video?

World Labs describe a Atlas como un omni-modelo entrenado desde cero con texto, imágenes, video y datos 3D. Cada entrada queda anclada a una posición específica del espacio tridimensional en lugar de procesarse como una secuencia plana. La compañía llama a esa comprensión espacial compartida "contexto espacial", y es lo que el modelo usa para generar cada nuevo cuadro o punto de vista. Según World Labs, ese anclaje es lo que separa a Atlas de los modelos puramente de lenguaje o de video.
Fei-Fei Li había planteado exactamente este problema en un ensayo de noviembre de 2025. Los modelos de lenguaje multimodales y los de difusión de video actuales, argumentó, descomponen los datos en secuencias de una o dos dimensiones, lo que vuelve innecesariamente difíciles hasta las tareas espaciales simples. Lo que se necesita son arquitecturas que organicen la tokenización, el contexto y la memoria de forma consciente del 3D o del 4D.
Un minuto de video en 1440p con la cámara bajo control

Para la generación controlada por cámara, Atlas toma una o más imágenes y produce vistas nuevas en posiciones y ángulos elegidos libremente. El movimiento de cámara se entrega como una entrada geométrica directa, no descrito mediante instrucciones de texto como exigen muchos modelos de video.
El modelo entrega hasta un minuto de video en 1440p. El usuario controla cada toma en vez de, según la expresión de la propia empresa, "tirar de la palanca de una máquina tragamonedas", una línea divisoria entre generación controlada y resultado aleatorio.
En reconstrucción espacial, Atlas rearma escenas reales a partir de entre una y varias decenas de imágenes de entrada, sin equipo de captura especial. Mientras más imágenes recibe, menos tiene que rellenar con su propio conocimiento.
Con solo dos o tres imágenes ya entrega resultados fieles y supera a los modelos 3D especializados, según la compañía, y también puede manejar más de cien entradas. En una demostración, el modelo ensambla progresivamente el patio principal de la Universidad de Stanford con entre 2 y 25 fotos tomadas a nivel del suelo, y genera vistas aéreas muy por encima del campus.
Ahí es donde los modelos existentes tienden a desarmarse. En una comparación dentro del marco OpenWorldLib, sistemas como VGGT e InfiniteVGGT mostraron inconsistencias geométricas y texturas borrosas apenas la cámara se movía de forma significativa.
Salida 3D nativa y simulación para robots
Atlas puede entregar resultados como datos 3D reales, no solo imágenes o video, porque procesa información de profundidad junto al RGB. Los formatos soportados incluyen nubes de puntos y 3D Gaussian splats, que construyen una escena a partir de muchos puntos de datos espaciales que se pueden recorrer de forma fluida desde cualquier ángulo. Es la misma representación que usa Marble, el producto que la empresa ya tiene en el mercado.
Como simulador, Atlas modela espacio y tiempo en conjunto. A partir de material capturado con apenas unas pocas cámaras puede producir un efecto de "tiempo bala" que congela una escena y permite verla desde ángulos de otro modo imposibles. El material de la demostración se grabó con un puñado de teléfonos y cámaras de acción, no con equipos profesionales.
Para robótica, Atlas funciona como herramienta de paso de lo real a la simulación. Reconstruye una habitación y genera los datos de imagen y profundidad que verían los sensores de un robot simulado a lo largo de su trayectoria. Con unas pocas fotos se pueden simular y variar tareas de agarre y desplazamiento intercambiando objetos, posiciones, iluminación o fondos. El objetivo es producir datos de entrenamiento diversos para robots sin tener que capturar cada situación en el mundo real.
World Labs ya había mostrado este enfoque en agosto de 2026 con su motor de real a simulación y de vuelta a lo real, como producto independiente. Ese motor crea miles de variantes a partir de una sola tarea del mundo real y entrena modelos de control enteramente en simulación. En cinco plataformas robóticas, los modelos corrieron una hora cada uno sin intervención humana, según la compañía. La tecnología viene de SceniX, una startup que World Labs adquirió en julio.
La generación de imágenes a partir de texto no es el foco principal, aclara la empresa, aunque Atlas también puede seguir instrucciones complejas, renderizar texto, producir estilos visuales distintos y crear panorámicas de 360 grados.
Velocidad de los modelos de lenguaje, calidad de la difusión
Atlas combina ideas de ambos mundos. Genera su salida por partes, como un modelo de lenguaje, así que puede aprovechar las mismas técnicas de aceleración, entre ellas el almacenamiento en caché de claves y valores. Pero también usa el principio de difusión de los modelos de imagen y video, filtrando gradualmente el resultado desde el ruido. Ese costado le da acceso a métodos que acortan el proceso de eliminación de ruido o mejoran la calidad de imagen.
World Labs sostiene que ningún punto de referencia único captura lo que Atlas puede hacer, pero apunta a dos conjuntos de pruebas: generación controlada por cámara evaluada por jueces humanos externos, y reconstrucción 3D con pocas vistas.
| Comparación | Evaluadores que prefirieron a Atlas |
|---|---|
| Contra MiniMax H3 | 75% |
| Contra Gemini Omni Flash | 81% |
| Contra Happy Horse 1.1 | 86% |
| Contra Seedance 2.5 | 94% |
En reconstrucción, Atlas lidera con un error mediano de 25,3, por delante de Pi3X y VGGT-Ω 1B, donde valores más bajos son mejores.
La empresa afirma que el rendimiento de Atlas mejora con más cómputo de entrenamiento y espera que esa tendencia se sostenga a medida que escale. Atlas alimentará versiones futuras de Marble y otros productos, y por ahora está disponible mediante un programa de acceso anticipado para socios seleccionados.
De fotos caminables a un omni-modelo
World Labs fue fundada en 2024 por Fei-Fei Li, creadora de ImageNet y responsable de la división de IA de Google Cloud entre 2017 y 2018. Desde su lanzamiento contó con el respaldo de Andreessen Horowitz, AMD, Intel y Nvidia.
Marble llegó en noviembre de 2025. En febrero de 2026 vino una ronda de financiamiento de 1.000 millones de dólares de Autodesk, Andreessen Horowitz, Nvidia y AMD. Bloomberg había reportado antes conversaciones con una valoración de 5.000 millones de dólares.
Qué cuenta como modelo de mundo sigue siendo materia de discusión entre investigadores. Un equipo internacional liderado por la Universidad de Pekín propuso una definición unificada en abril de 2026 a través de OpenWorldLib, que excluye a los modelos puramente de texto a video porque carecen de circuitos de retroalimentación con el mundo real. La reconstrucción 3D y los simuladores como los de Atlas sí califican como piezas centrales en ese marco, porque entregan entornos donde las reglas físicas se pueden verificar.




