GPT-6 Astra, el modelo de OpenAI, completó 7 de 100 tareas de manipulación en StationeryBench, y MolmoAct2, del Allen Institute for AI, no cerró ninguna. El dato lo publicó The Decoder el 12 de septiembre de 2026. Las dos redes manejaron el mismo robot YAM de dos brazos, con 200 ensayos repartidos entre ambas.

Las pruebas usan objetos de escritorio. Destapar un marcador, vaciar un pote de clips y pasar una regla de un brazo al otro. Los resultados, los videos y el código del banco de pruebas están publicados en GitHub.

¿Qué separa a Astra de MolmoAct2?

StationeryBench no mide solo la tarea terminada. También calcula un puntaje de progreso que reparte crédito parcial cuando el robot avanza en la secuencia y se cae antes del final. En esa medición Astra quedó con una mediana de 46 sobre 100 y MolmoAct2 con 12.

MediciónGPT-6 AstraMolmoAct2
Tareas completas7 de 1000 de 100
Progreso, mediana46 de 10012 de 100
RobotYAM de dos brazosYAM de dos brazos
Tareas evaluadas55

Ninguno de los dos modelos pasó la mitad del puntaje de progreso. La comparación corre sobre cinco tareas y el mismo hardware, así que la diferencia queda atribuida al modelo que da las órdenes.

¿Qué dijo el investigador que revisó los datos?

Yoav Artzi, investigador de inteligencia artificial en Cornell y en Google DeepMind, describió el resultado de Astra como "un salto de nivel en el razonamiento espacial".

En REMAP, otro banco de pruebas que todavía no se publica, GPT-Astra alcanza una precisión cercana a la humana. Artzi puso un límite a esa lectura.

"Incluso ASTRA no llega a lo que hacen los humanos en otros escenarios", señaló el investigador.

¿De dónde sale la ventaja en tareas 3D?

Artzi sospecha que OpenAI entrenó el modelo con grandes volúmenes de datos en tres dimensiones, entre ellos escenas de Blender. La hipótesis calza con el lugar donde Astra mejora, que son justamente las tareas en 3D. OpenAI mantiene planes de largo plazo para fabricar sus propios robots de consumo.