Los datasets de manipulación robótica han crecido mucho más lento que los modelos que se entrenan con ellos, principalmente porque la recolección de datos permanece cerrada y centralizada. Los operadores expertos reúnen demostraciones en hardware de laboratorio, las procesan offline y entregan un benchmark fijo que nunca vuelve a crecer. Un equipo de investigación de Axis Robotics, UC Berkeley, Georgia Tech, NTU y otros, propone un enfoque distinto. Su sistema, AXIS, traslada la recolección de demostraciones al navegador, envía el resto a GPUs en el backend y trata al dataset como algo que sigue expandiéndose en lugar de algo que se publica una sola vez.

¿Es desplegable? Parcialmente. El código de entrenamiento es público como una capa de parche sobre OpenPI, y la plataforma de teleoperación funciona en cualquier navegador. El dataset en Hugging Face está limitado a 2.36 TB y restringido a uso académico no comercial. No se han liberado checkpoints de políticas.

¿Cómo funciona la división entre navegador y backend?

La decisión fundamental del sistema es la asimetría. Los colaboradores teleoperan un Franka Research 3 con una pinza paralela dentro de un frontend de MuJoCo WebAssembly, usando teclado, mouse, joystick virtual o gamepad. El paso de física y el renderizado Three.js se ejecutan fuera del hilo de la interfaz de React, por lo que las muestras de estado-acción registradas permanecen alineadas con el simulador en lugar de con la interfaz. Todo lo costoso ocurre en otro lugar: el renderizado en 8 GPUs RTX 4090, y el entrenamiento y evaluación en 8 GPUs A100.

Las tareas en sí son generadas en lugar de creadas manualmente. TaskGen descompone una instrucción en lenguaje natural en configuraciones de tarea, escena y objeto, recupera o genera mallas a través de un pipeline de imagen a 3D, las reescala a un tamaño físico plausible y luego propone un diseño en 2.5D. Un supervisor de diseño valida la escena instanciada y reubica, reorienta o regenera objetos cuando las restricciones fallan. Cada tarea se entrega con un verificador de éxito estructurado, que el backend vuelve a ejecutar en lugar de confiar en la bandera de éxito del frontend.

¿Qué contiene el dataset liberado?

La instantánea publicada contiene 207 tareas, 50.129 episodios y más de 60.000 variantes de tareas o escenas en siete categorías. Cada trayectoria incluye metadatos de tarea, encarnación, versión del simulador, estados del robot y objetos, acciones, etiquetas de éxito y observaciones RGB-D de tercera vista y de muñeca. El artículo acredita a más de 70.000 miembros de la comunidad con sus contribuciones.

La limpieza se trata como una etapa de producción. Las muestras con una variación articular inferior a 5e-3 se descartan por ser estáticas; un filtro Savitzky-Golay con ventana de 15 y orden polinomial de 3 suaviza el movimiento continuo, y las splines cúbicas remuestrean desde los 6 Hz a 8 Hz que produce la interfaz web hasta un objetivo de 20 Hz. La Tabla 1 es honesta sobre la compensación: la aceleración media cae de 1.3539 a 0.4885 y el tirón (jerk) medio de 11.5899 a 2.2243, mientras que el éxito de reproducción cae del 100% al 86.2%.

Los episodios limpios se reproducen luego en IsaacSim desde el estado del simulador empaquetado con el paso de física desactivado, de modo que la trayectoria verificada sigue siendo autoritativa mientras las escenas, cámaras, materiales y luces se aleatorizan a su alrededor. El resultado es un RGB con trazado de rayos de 256×256 desde una cámara fija de tercera vista y una cámara de muñeca, con la profundidad desactivada por defecto.

¿Cuáles son los resultados en LIBERO-Plus?

Cada condición parte del checkpoint π0.5 liberado, una base PaliGemma Gemma-2B con un experto en acciones Gemma-300M, que continúa opcionalmente el preentrenamiento en un corpus de simulación, para luego realizar un ajuste fino (fine-tuning) en LIBERO con hiperparámetros idénticos. El preentrenamiento es de modelo completo sin LoRA, utilizando una pérdida de coincidencia de flujo sobre fragmentos de acción de 10 pasos durante 100.000 pasos, seguidos de 30.000 pasos de post-entrenamiento en LIBERO.

π0.5 más AXIS-100% alcanza 88.8 en general en LIBERO-Plus frente a 83.9 para π0.5 estándar y 57.5 para un control RoboCasa365 igualado en número de trayectorias. El resumen cita 5.8% y 37.3%; ambas son cifras relativas normalizadas por la línea base de 83.9, por lo que las brechas de puntos de 4.9 y 31.3 son la lectura más clara. El escalado se mantiene a nivel agregado: 84.7 a 85.7 a 88.8 a través de las instantáneas del 25%, 50% y 100%.

Por eje, las mayores ganancias ocurren donde el pipeline de aumento realmente aleatoriza: ruido del sensor +13.7 y cámara +11.3. El fondo gana 3.7, la pose del robot 3.8 y el diseño 2.6. La luz y el lenguaje retroceden, en 1.7 y 1.3 respectivamente. La cámara también cae a 68.8 en AXIS-50%, por debajo de la línea base de 72.5, antes de recuperarse. El escalado es consistente en agregado y ruidoso por eje.

Conclusiones clave

  • 207 tareas y 50.129 trayectorias verificadas, recolectadas a través de un frontend de navegador MuJoCo-WASM sin GPU local ni robot.
  • El preentrenamiento continuo eleva π0.5 de 83.9 a 88.8 en general en LIBERO-Plus, una ganancia de 4.9 puntos.
  • Un control RoboCasa365 de volumen igualado obtiene 57.5, por lo que la ganancia no se explica solo por el volumen de simulación.
  • El refinamiento reduce la aceleración media en un 63.9% y el tirón (jerk) medio en un 80.8%, a costa de que el éxito de reproducción caiga al 86.2%.
  • Dos ejes de perturbación, luz y lenguaje, retroceden frente a la línea base estándar.

Consulte el artículo científico, la página del proyecto, el dataset y la plataforma. También, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de 150k+ ML y suscribirse a nuestro boletín. ¿Está en Telegram? ahora puede unirse a nosotros en Telegram también.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub, página de Hugging Face, lanzamiento de producto o webinar? Conéctese con nosotros

Vía MarkTechPost.