Mistral presentó el 8 de julio Robostral Navigate, su primer modelo hecho para navegación encarnada. Son 8.000 millones de parámetros que toman imágenes RGB y una instrucción en lenguaje corriente, y mueven un robot a través de un entorno.
"Sal del vestíbulo, camina por el pasillo, entra a la sala de suministros y detente frente a la segunda estantería."
Para resolver una tarea así, otros modelos suelen recurrir a sensores de profundidad, lidar o varias cámaras trabajando juntas. Robostral Navigate usa una sola cámara RGB corriente y ningún sensor de profundidad.
¿Qué tan lejos llega con una cámara?
El modelo marca 76,6% en R2R-CE, el conjunto de validación no visto del benchmark que mide seguir instrucciones en entornos dejados fuera del entrenamiento. Sobre el conjunto visto llega a 79,4%. Con eso le gana por 9,7 puntos al mejor enfoque de una sola cámara y por 4,5 puntos al mejor sistema que usa profundidad o varias cámaras, sin usar ninguna de las dos cosas.
%203-1.svg>)
%203-1.svg>)
%203-1.svg>)
%203-1.svg>)
Mistral apunta el modelo a oficinas, edificios residenciales y comerciales, y entornos exteriores, con aplicaciones en manufactura, reparto, logística y hotelería. La empresa dice que basta una instrucción para que el robot complete la tarea entero, moviéndose por un espacio vivo lleno de gente y de obstáculos que nunca vio.
Otras características que declara. Corre en robots con ruedas, con patas y voladores, y generaliza entre tamaños de robot. Tolera diferencias en los parámetros internos de la cámara. Y el entrenamiento es eficiente en tokens gracias al cacheo de prefijos.
Navegación por señalamiento
Dada una tarea y un historial de observaciones, Robostral Navigate predice hacia dónde debe moverse el robot mediante señalamiento. Infiere las coordenadas de imagen del lugar de destino dentro de la vista actual de la cámara, junto con la orientación deseada al llegar. A diferencia de los comandos que dependen de desplazamientos métricos, señalar deja a la política indiferente ante cambios en los parámetros internos de la cámara y en la escala del mundo.
El método tiene un límite. No sirve cuando el destino queda fuera del campo de visión actual. Cuando señalar no aplica, el modelo cae en desplazamientos expresados en el sistema de coordenadas local del robot, del tipo "avanza 2 metros, 1,5 metros a la izquierda y gira 25 grados a la izquierda".
Construido de cero
Robostral Navigate está hecho enteramente en casa y no se apoya en modelos de visión y lenguaje de código abierto ya existentes. Parte inicializado desde el modelo de visión y lenguaje de Mistral especializado en tareas de anclaje, como señalar, contar y localizar objetos. La navegación aparece como una extensión natural de esas capacidades. Una vez que entiende dónde están las cosas, aprende cómo moverse.
El equipo armó una tubería de generación de datos enteramente en simulación, lo que permitió iterar rápido sobre los datos. El conjunto resultante tiene alrededor de 2,4 millones de trayectorias recolectadas en 350.000 escenas.
Entrenamiento supervisado eficiente
Un ingrediente central es un algoritmo de entrenamiento basado en cacheo de prefijos. Con una estrategia de enmascaramiento de atención en árbol, el método comprime un episodio completo en una sola secuencia. Eso permite entrenar sobre todos los pasos de tiempo en una única pasada hacia adelante, sin que se filtre información entre pasos.
Comparado con entrenar usando una muestra por paso de tiempo, el enfoque reduce 22 veces la cantidad de tokens de entrenamiento y conserva todas las señales de aprendizaje. En la práctica, convierte corridas de entrenamiento que tomarían meses en corridas que terminan en días.
Aprendizaje por refuerzo en línea
Después de la etapa supervisada, Mistral mejora el modelo con CISPO, un algoritmo de aprendizaje por refuerzo en línea, apoyado en su experiencia en post-entrenamiento de modelos de lenguaje a escala. Eso le permite al modelo aprender por ensayo y error, recuperarse de fallas y adquirir comportamientos exploratorios, lo que mitiga el desplazamiento de distribución de la clonación de comportamiento a secas. Solo esa etapa subió la tasa de éxito en 3,2%.
El informe técnico de Robostral Navigate tiene la arquitectura completa, la configuración de entrenamiento y los resultados de los benchmarks. Lo firman Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh y Olivier Duchenne.




