¿Qué es Gemini Robotics 2 y cómo transforma la robótica?

Google Deepmind ha presentado oficialmente Gemini Robotics 2, calificado por la empresa como su modelo de visión-lenguaje-acción (VLA) más avanzado hasta la fecha. Los modelos VLA integran reconocimiento de imágenes, procesamiento de lenguaje natural y control de acciones, permitiendo que los robots operen de manera efectiva en entornos físicos complejos.

Según Deepmind, este modelo tiene la capacidad de controlar una amplia variedad de sistemas robóticos, abarcando desde brazos mecánicos de escritorio hasta robots humanoides de cuerpo completo. La compañía define a Gemini Robotics 2 como una "capa de inteligencia" diseñada para una nueva generación de máquinas adaptativas. El sistema puede gestionar movimientos corporales complejos, ejecutar tareas de motricidad fina y coordinar la acción de múltiples unidades robóticas simultáneamente. Los desarrolladores interesados pueden solicitar acceso anticipado a través de la lista de espera oficial.

¿Qué aporta Gemini Robotics ER 2 al razonamiento físico?

Además del modelo principal, Google Deepmind introdujo Gemini Robotics ER 2, un modelo diseñado específicamente para el "razonamiento encarnado" (embodied reasoning). Este concepto hace referencia a la capacidad de una máquina para comprender el mundo físico y tomar decisiones lógicas basadas en esa información visual y espacial.

El nuevo modelo ER 2 funciona como un sistema de control de alto nivel para robots, reemplazando a Gemini Robotics ER 1.6, que fue lanzado en abril pasado. Esta actualización busca mejorar la precisión en la toma de decisiones autónomas en tiempo real. Gemini Robotics ER 2 ya se encuentra disponible para pruebas y desarrollo dentro de Google AI Studio.

Vía The Decoder.