Gemini Robotics 2: Inteligencia corporal para robots
Desde los pies hasta la punta de los dedos, estamos enseñando a los robots a lograr un control corporal inteligente, destreza fina y trabajo en equipo para completar una amplia gama de tareas complejas.
Durante décadas, hemos soñado con robots que puedan integrarse perfectamente en nuestro mundo y echar una mano. Ahora, esa visión da un paso adelante significativo. La mayoría de los robots actuales están preprogramados o son teleoperados para secuencias de tareas estrechas y repetitivas. Carecen de la capacidad de aprender realmente por sí mismos o de adaptarse a entornos impredecibles. Además, transferir habilidades aprendidas de un cuerpo robótico a otro sigue siendo increíblemente difícil. Para abordar los problemas más difíciles a escala, los robots de todas las formas y tamaños necesitan modelos de IA que les den la capacidad de pensar, actuar e interactuar de manera inteligente para completar tareas de forma segura.
Demostramos cómo la comprensión multimodal de Gemini podría impulsar la acción en el mundo real con Gemini Robotics. Hoy, presentamos Gemini Robotics 2, la capa de inteligencia que impulsa a la próxima generación de robots verdaderamente adaptables. A medida que da sus primeros pasos literales, este avance importante desbloquea el control corporal inteligente, la destreza avanzada y la colaboración entre múltiples robots.
Gemini Robotics 2 permite a los robots razonar a través de cada movimiento, desbloqueando una amplia gama de tareas. Por ejemplo, puede permitir que un humanoide camine, se agache, se estire y manipule objetos para limpiar una habitación desordenada. Incluso puede formar equipo con otros robots para terminar el trabajo más rápido. Y esta profunda inteligencia también puede ejecutarse localmente en el dispositivo mientras se adapta perfectamente a cuerpos robóticos completamente nuevos en solo unas pocas horas.
Estamos haciendo esto posible a través de tres modelos altamente capaces:
- Gemini Robotics 2: Nuestro modelo de visión-lenguaje-acción (VLA) más avanzado, que convierte la entrada de visión y lenguaje en control motor, permitiendo que un robot actúe. Este modelo es capaz de controlar humanoides completos, desde los pies hasta las puntas de los dedos, y otros robots de dos brazos. También aporta un nuevo nivel de manipulación diestra tanto en manos como en pinzas.
- Gemini Robotics ER 2: Nuestro modelo de razonamiento encarnado (ER) más capaz. Es un modelo de lenguaje visual (VLM) que actúa como nuestro agente, permitiendo a los robots comunicarse con los humanos, comprender el mundo físico y planificar tareas de varios pasos que duran varios minutos. También estamos introduciendo la capacidad de que los robots trabajen juntos como un equipo.
- Gemini Robotics On-Device 2: Nuestro modelo de visión-lenguaje-acción (VLA) más eficiente, optimizado para ejecutarse localmente en dispositivos robóticos. Este modelo ahora puede lograr una rápida adaptación a nuevas encarnaciones robóticas con solo unas pocas horas de datos.
El diagrama anterior ilustra cómo el mismo modelo checkpoint puede operar arquitecturas físicas diversas, desde el humanoide Apollo 2 hasta sistemas Franka.
El gráfico muestra una precisión del 92% en desenroscar bombillas, destacando la mejora en la manipulación fina.
La versión en modo oscuro del gráfico anterior detalla las métricas de error y desempeño en tareas de precisión.
Las pinzas del Franka Duo alcanzan un 74.2% de precisión en tareas generales de recolección y posicionamiento.
El modelo permite que incluso pinzas estándar logren una ejecución de tareas complejas con alta fiabilidad.
Gemini Robotics ER 2, nuestro modelo de razonamiento, ya está disponible en Google AI Studio y en vista previa privada en la Gemini Enterprise Agent Platform. Nuestros modelos VLA y On-Device están disponibles para socios de acceso temprano. Lea cómo llevar estos modelos a su hardware en nuestro blog para desarrolladores.
¿Cómo gestiona Gemini Robotics 2 las tareas de cuerpo completo?
El mundo está construido para los movimientos humanos; requiere que alcancemos, nos doblemos y mantengamos el equilibrio en espacios reducidos y desordenados. Si bien nuestros modelos anteriores controlaban la parte superior del cuerpo del humanoide para lograr tareas de mesa, Gemini Robotics 2 expande la IA física hacia movimientos de cuerpo completo.
Por primera vez, nuestro modelo puede controlar robots humanoides completos, traduciendo la intención en un control corporal inteligente. Por ejemplo, al controlar el humanoide Apptronik’s Apollo 2, podemos pedirle que "ponga la regadera en el contenedor verde del estante inferior". Apollo procesa la instrucción, camina hacia la mesa, recoge la regadera, da algunos pasos hacia los estantes y la coloca con precisión en su destino. Aunque a nuestros robots les falta avanzar en la velocidad de movimiento, este es un paso importante hacia las habilidades necesarias para completar tareas más complejas y del mundo real que requieren coordinación de cuerpo completo.
¿Qué nivel de destreza alcanzan las manos y pinzas?
Para ser genuinamente útiles en nuestros hogares y lugares de trabajo, los robots necesitan delicadeza. Gemini Robotics 2 desbloquea un nuevo nivel de destreza física a través de diferentes efectores finales, ya sea que un robot esté usando manos o pinzas, lo que permite que los robots sean más útiles que nunca.
El modelo ahora puede controlar la mano SharpaWave de cinco dedos y 22 grados de libertad en el robot Apollo 2 para completar acciones delicadas como atar nudos o sellar una bolsa ziplock. También puede operar pinzas paralelas estándar de dos dedos en una plataforma Franka Duo para realizar tareas diestras complejas (por ejemplo, empaquetado ajustado). Seguimos avanzando en el nivel de precisión y velocidad para alcanzar una destreza de nivel humano.
¿Cómo funciona la colaboración multi-robot?
La mayoría de las tareas del mundo real requieren múltiples pasos durante un período prolongado de tiempo. Para gestionar esta complejidad, nuestro modelo de razonamiento encarnado (ER), Gemini Robotics ER 2, sirve como el cerebro de alto nivel del robot, procesando las instrucciones del usuario y comunicándose con los humanos. Observa la habitación, razona sobre los pasos necesarios para completar la tarea, coordina con el VLA para realizar las acciones y rastrea el progreso hasta que se completa la tarea. Esta configuración permite a los robots ejecutar tareas complejas de varios pasos, autocorregirse si un paso falla y generalizar a situaciones y objetivos novedosos.
En esta actualización, permitimos que los robots ejecuten de manera más confiable secuencias de tareas más largas, que duran varios minutos e involucran cientos de decisiones. Gemini Robotics ER 2 ahora comprende cuándo comienzan y terminan las tareas, y puede identificar el momento en que ocurren eventos clave.
Vía Google DeepMind.




