Gemini Robotics 2: el nuevo cerebro de Google DeepMind para robots adaptativos

  • Google DeepMind presenta Gemini Robotics 2, un modelo de visión, lenguaje y acción que controla robots humanoides completos.
  • Incluye tres modelos: VLA para ejecución, ER 2 para razonamiento y On-Device 2 para funcionamiento local.
  • Permite tareas de precisión como atar nudos o desenroscar bombillas, con tasas de acierto superiores al 90%.
  • Los robots pueden colaborar entre sí y el sistema se detiene automáticamente si una persona se acerca.

Gemini Robotics 2 de Google DeepMind

Google DeepMind ha dado un paso de gigante en la robótica con el lanzamiento de Gemini Robotics 2, su modelo de visión, lenguaje y acción más avanzado. Esta nueva capa de inteligencia promete convertir a los robots en máquinas verdaderamente adaptables, capaces de razonar sobre cada movimiento y ejecutar tareas complejas en entornos reales. La compañía lo presenta como un cerebro universal que puede instalarse en cualquier tipo de hardware robótico, desde brazos industriales hasta humanoides completos.

El sistema se articula en torno a tres modelos especializados que trabajan de forma conjunta. Por un lado, el modelo VLA (visión, lenguaje y acción) se encarga de traducir las instrucciones en movimientos físicos. El modelo ER 2 actúa como el cerebro de alto nivel, planificando tareas y comunicándose con humanos. Y el modelo On-Device 2 está optimizado para ejecutarse localmente en el robot, sin depender de conexión a internet. Esta arquitectura permite que el robot piense y actúe al mismo tiempo, eliminando las pausas que hasta ahora eran habituales en sistemas similares.

Gemini en Google Home
Artículo relacionado:
Gemini en Google Home: todo sobre su despliegue y novedades

Tres modelos para una inteligencia robótica completa

Modelos de Gemini Robotics 2

El modelo de visión, lenguaje y acción (VLA) es el encargado de controlar el cuerpo del robot de forma directa. Por primera vez, puede gestionar humanoides completos, desde los dedos de los pies hasta las manos, permitiendo caminar, agacharse, estirarse y manipular objetos con destreza. En las pruebas, ha demostrado una precisión del 90% en tareas de inserción con pinzas robóticas y un 92% al desenroscar bombillas con manos de cinco dedos y 22 grados de libertad.

El modelo Gemini Robotics ER 2, por su parte, se dedica al razonamiento integrado. Actúa como un agente que observa el entorno, planifica secuencias de varios pasos y se coordina con el VLA para ejecutarlas. Puede recurrir a herramientas externas como la Búsqueda de Google cuando necesita información adicional, y es capaz de analizar vídeo en tiempo real para supervisar el progreso de una tarea. Según Google, este modelo alcanza una precisión del 57,4% en la estimación del progreso y del 91,3% en la identificación de eventos clave, con un margen de error inferior a un segundo.

El tercer modelo, Gemini Robotics On-Device 2, está diseñado para funcionar sin conexión. Puede adaptarse a un robot completamente nuevo en solo unas horas, entrenándolo con menos de 200 ejemplos. Esto lo hace ideal para entornos donde la latencia o la privacidad son críticas, como fábricas o dispositivos conectados en domicilios particulares.

Control corporal completo y destreza sin precedentes

Robot humanoide con Gemini Robotics 2

Una de las novedades más llamativas es el control de todo el cuerpo. Mientras que los modelos anteriores solo manejaban la parte superior del robot para tareas sobre una mesa, Gemini Robotics 2 amplía la inteligencia artificial física a movimientos completos. Los robots pueden ahora caminar, agacharse, estirarse y manipular objetos mientras planifican acciones complejas. En las demostraciones, el robot Apollo 2 de Apptronik, equipado con manos SharpaWave, fue capaz de ordenar estanterías y atar nudos con total precisión.

La destreza fina también ha mejorado de forma notable. El modelo puede controlar pinzas paralelas de dos dedos para tareas que requieren fuerza, así como manos de cinco dedos para acciones delicadas. Entre las habilidades demostadas están cerrar bolsas, hacer nudos, desenroscar bombillas y ensamblar piezas pequeñas. Google ha publicado datos que avalan estas capacidades: las tareas de inserción precisa alcanzan un 90% de acierto, y las de desenroscado un 92%.

Mango y Avocado, nuevos modelos de IA de Meta
Artículo relacionado:
Mango y Avocado: así son los nuevos modelos de IA de Meta

Colaboración entre robots y razonamiento en tiempo real

Colaboración multi-robot

Otra de las grandes innovaciones es la capacidad de coordinar múltiples robots en un mismo espacio de trabajo. Gemini Robotics ER 2 permite que máquinas de diferentes tipos compartan una comprensión común del entorno y se repartan las tareas. En una de las pruebas, un robot Franka F3 Duo introducía objetos en cajas mientras el humanoide Apollo 2 las colocaba en una estantería. Según Google, ninguno de los dos habría podido completar la tarea por sí solo, pero trabajando juntos lograron finalizarla con éxito.

El sistema también incorpora un seguimiento del progreso en tiempo real. Mediante el análisis continuo del vídeo capturado por el robot, el modelo clasifica cada fotograma en una escala de cinco niveles, desde el inicio hasta la finalización de la actividad. Si surge un problema inesperado, el robot puede identificar el punto exacto del fallo y continuar desde ahí tras corregirlo, sin necesidad de reiniciar todo el flujo de trabajo. Esto supone un avance significativo frente a versiones anteriores, donde cualquier error obligaba a empezar de cero.

Seguridad y disponibilidad para desarrolladores

Seguridad en Gemini Robotics 2

Google ha puesto un énfasis especial en la seguridad de esta nueva generación. El modelo incluye un enfoque multicapa con marcos sólidos de protección y una nueva herramienta de evaluación llamada ASIMOV-Agentic, que mide si los robots rechazan órdenes peligrosas, detectan situaciones inciertas y se detienen cuando una persona se acerca demasiado. En las demostraciones, el sistema fue capaz de parar automáticamente el movimiento de un robot humanoide al detectar a un humano en su área de trabajo, y reanudar la actividad una vez que la zona quedaba despejada.

Gemini Robotics ER 2 ya está disponible para desarrolladores a través de la API de Gemini, Google AI Studio y en versión preliminar privada en Gemini Enterprise Agent Platform. Los modelos VLA y On-Device 2, por su parte, solo están accesibles para socios con acceso anticipado. Google espera que esta tecnología acelere la adopción de robots en sectores como la logística, la manufactura y el hogar, donde la versatilidad y la seguridad son críticas.

La combinación de razonamiento continuo, comprensión del entorno, planificación de múltiples pasos, colaboración entre robots e integración con herramientas externas sitúa a Gemini Robotics 2 como uno de los desarrollos más avanzados de DeepMind hasta la fecha. Con este lanzamiento, Google refuerza su apuesta por la inteligencia artificial física, buscando que los robots puedan realizar cualquier tarea que un humano haría, desde poner el lavaplatos hasta trabajar en una fábrica, todo ello con la fluidez y la seguridad necesarias para convivir con las personas.

ChatGPT
Artículo relacionado:
GPT-5 reordena ChatGPT: cambios clave, límites y debate

Añadir como fuente preferida en Google