Google DeepMind presentó la semana pasada Gemini Robotics 2, la versión más reciente de su modelo de visión, lenguaje y acción (VLA, por su sigla en inglés).
Con la primera versión, la compañía mostró cómo la comprensión multimodal de Gemini podía traducirse en acción sobre el mundo real. La versión actualizada incorpora control inteligente de cuerpo completo, destreza avanzada y colaboración entre múltiples robots, informó DeepMind.
Gemini Robotics 2 permite que los robots razonen cada movimiento, lo que abre un rango amplio de tareas. Puede, por ejemplo, hacer que un humanoide camine, se agache, se estire y manipule objetos para ordenar una habitación desordenada. El robot también podría coordinarse con otros robots para terminar antes.
El modelo además corre localmente en el dispositivo y se adapta a cuerpos robóticos completamente nuevos en apenas unas horas, según DeepMind. Junto al modelo VLA, la empresa liberó:
- Gemini Robotics ER 2: un modelo de razonamiento corporizado que funciona como modelo de visión y lenguaje. Actúa como el agente de DeepMind y permite que los robots se comuniquen con personas, entiendan el mundo físico y planifiquen tareas de varios pasos que duran varios minutos.
- Gemini Robotics On-Device 2: la compañía optimizó este VLA para correr localmente en el robot. Ahora logra adaptación rápida a cuerpos robóticos completamente nuevos con unas pocas horas de datos.
Gemini Robotics ER 2 ya está disponible en Google AI Studio y en vista previa privada dentro de la plataforma de agentes empresariales de Google. Los modelos VLA y On-Device quedan reservados a socios de acceso anticipado.
¿Qué significa controlar el cuerpo completo?
Los modelos previos de DeepMind manejaban el tren superior del humanoide para resolver tareas sobre una mesa. Gemini Robotics 2 lleva la IA física al movimiento de cuerpo entero.
El modelo controla humanoides completos y traduce la intención en control corporal coordinado. Al operar el humanoide Apollo 2 de Apptronik, por ejemplo, se le puede pedir que ponga la regadera en el contenedor verde del estante inferior.
Apollo procesa la instrucción, camina hasta la mesa, toma la regadera, da unos pasos hacia los estantes y la deja con precisión en su destino. DeepMind reconoce que a los robots todavía les falta velocidad de movimiento, pero considera esto un paso relevante hacia las habilidades necesarias para tareas reales que exigen coordinación de todo el cuerpo.
Para ser genuinamente útiles en casas y lugares de trabajo, sostiene la compañía, los robots necesitan finura. Gemini Robotics 2 habilita un nuevo nivel de destreza física con distintos efectores finales, sean manos o pinzas.
El modelo controla la mano SharpaWave de cinco dedos y 22 grados de libertad montada en el robot Apollo 2 para acciones delicadas como hacer nudos o sellar una bolsa con cierre hermético. También opera pinzas paralelas estándar de dos dedos sobre una plataforma Franka Duo para tareas de manipulación compleja, como empaquetado ajustado.
¿Cómo coordina tareas que requieren varios robots?
La mayoría de las tareas del mundo real exige varios pasos durante un período extendido, señaló Google DeepMind. Para manejar esa complejidad, Gemini Robotics ER 2 funciona como el cerebro de alto nivel del robot: procesa las instrucciones del usuario y se comunica con las personas.
Observa la sala, razona los pasos necesarios para completar la tarea, se coordina con el VLA para ejecutar las acciones y monitorea el avance hasta terminar. Ese esquema permite ejecutar tareas complejas de varios pasos, autocorregirse si un paso falla y generalizar a situaciones y objetivos nuevos.
Con la actualización, DeepMind afirma que los robots ejecutan de forma más confiable secuencias largas, de varios minutos de duración y cientos de decisiones. Gemini Robotics ER 2 ahora entiende cuándo comienzan y terminan las tareas, y puede identificar el momento exacto en que ocurren los eventos clave.
La compañía también introduce la colaboración entre múltiples robots, que permite a robots de distinto tipo comunicarse y trabajar juntos en flujos que un solo robot no podría resolver.
Gemini Robotics On-Device 2 apunta a entornos sin conectividad
Muchas aplicaciones robóticas necesitan operar sin latencia de red ni conexión a internet. DeepMind construyó Gemini Robotics On-Device 2 para esas restricciones.
Este modelo es nativamente multi-cuerpo y hereda las técnicas de transferencia de movimiento de Gemini Robotics 1.5. Ahora se adapta a plataformas nuevas de doble brazo con solo unas horas de ajuste, típicamente con menos de 200 ejemplos, incluso cuando esos cuerpos tienen formas, sensores y grados de libertad drásticamente distintos.
| Capacidad | Modelos previos | Gemini Robotics 2 |
|---|---|---|
| Alcance del control | Tren superior, tareas sobre mesa | Cuerpo completo, incluye desplazamiento |
| Destreza | Pinzas y manipulación básica | Mano de 22 grados de libertad, nudos y cierres |
| Adaptación a un cuerpo nuevo | Reentrenamiento extenso | Horas, con menos de 200 ejemplos |
| Trabajo coordinado | Un robot | Varios robots de distinto tipo |
Seguridad: un banco de pruebas nuevo
Google DeepMind sostiene que la seguridad es la base de su investigación en robótica. La compañía introdujo ASIMOV-Agentic, un banco de pruebas para orquestación segura de agentes y resolución de incertidumbre. Mide, por ejemplo, la capacidad del agente de razonamiento corporizado para rechazar llamadas a herramientas que sean inseguras, y también su capacidad de predecir si una tarea es posible y de pedir intervención humana de manera proactiva cuando duda.
Con el razonamiento corporizado reforzado, DeepMind afirma que Gemini Robotics ER 2 es su modelo de robótica más seguro hasta la fecha en cumplimiento de restricciones y en pruebas de proximidad humana. Detecta mejor cuando hay personas cerca, dispara llamadas de seguridad y lleva el robot a una detención segura si alguien se aproxima demasiado. Ese es un requisito clave en las normas de seguridad colaborativa, las mismas que rigen cualquier celda industrial donde robots y operarios comparten espacio de trabajo.




