En clave inbound | Goat blog de Titular

Google DeepMind lanza Gemini Robotics ER 2: La IA que revoluciona la robótica

Escrito por titular.com | 12/08/26

Google DeepMind presentó Gemini Robotics ER 2, su modelo de razonamiento encarnado más avanzado, que permite a los robots planificar, autocorregirse en tiempo real y colaborar entre sí.

La robótica acaba de dar un salto cualitativo histórico. Google DeepMind anunció el lanzamiento de Gemini Robotics ER 2, la nueva generación de su modelo de razonamiento encarnado (Embodied Reasoning). A diferencia de los sistemas tradicionales que ejecutan tareas preprogramadas de forma aislada, este nuevo "cerebro" dota a los robots de la capacidad de comprender su entorno, adaptarse a imprevistos en tiempo real y, por primera vez, orquestar tareas colaborativas entre múltiples máquinas en espacios compartidos.

Esta actualización representa una evolución fundamental sobre su predecesor, el Gemini Robotics ER 1.6. Mientras que los modelos de visión-lenguaje-acción (VLA) se encargan de los movimientos de bajo nivel, Gemini Robotics ER 2 opera en una capa superior: toma decisiones complejas, interpreta señales de video de forma continua y planifica los siguientes pasos mientras el robot aún está ejecutando la acción actual.

¿Cómo funciona Gemini Robotics ER 2?

Basado en la arquitectura de Gemini 3.5 Flash, este modelo de lenguaje de visión (VLM) no solo reconoce objetos y entornos, sino que procesa esa información con una velocidad inédita. Según Google, el sistema alcanza un 0.96 segundos de distancia absoluta media en tareas de búsqueda temporal y una precisión del 57.4% en clasificación de progreso, superando holgadamente a sus competidores.

Las características principales que definen a esta nueva herramienta incluyen:

  • Autocorrección en tiempo real: Gracias a la monitorización continua de video, el robot puede evaluar su propio desempeño, identificar errores en el momento y recalcular su ruta o acciones sin necesidad de intervención humana.
  • Colaboración Multi-robot: Un hito en la industria. Gemini Robotics ER 2 permite que varios robots coordinen acciones conjuntas para completar flujos de trabajo que serían imposibles para una sola máquina.
  • Velocidad de ejecución: El modelo compite con sistemas mucho más grandes, pero ofrece resultados con un costo computacional menor y una velocidad de ejecución cuatro veces superior, logrando una latencia inferior a un segundo, vital para la seguridad en entornos físicos.
  • Integración con herramientas externas: Puede acceder nativamente a la Búsqueda de Google o a APIs personalizadas para obtener la información necesaria para completar una tarea.

"Gemini Robotics ER 2 representa un cambio radical en la forma en que otorga comprensión de vídeo, orquestación de tareas y colaboración entre múltiples robots, lo que permite que sean más útiles en el mundo físico", afirmaron Steven Hansen y Peng Xu, ingenieros de software de Google, durante la presentación.

Casos de uso y disponibilidad

Para las empresas que buscan implementar soluciones de automatización inteligente, este lanzamiento reduce drásticamente la brecha entre los proyectos piloto controlados y el despliegue en el mundo real. La capacidad del modelo para generalizar situaciones nuevas significa que los robots pueden adaptarse a entornos dinámicos y no estructurados con mucha mayor fiabilidad.

Actualmente, el modelo se presenta en dos variantes principales:

  1. gemini-robotics-er-2-preview: El modelo estándar enfocado en el razonamiento espacial y la coordinación de tareas complejas de múltiples pasos.
  2. gemini-robotics-er-2-streaming-preview: Optimizado para la transmisión bidireccional de audio y video en tiempo real, ideal para interacciones de baja latencia con humanos.

La API de Gemini Robotics ER 2 ya se encuentra disponible para desarrolladores a través de Google AI Studio, y en versión preliminar privada en la plataforma de agentes de Gemini Enterprise.

Análisis y perspectivas

El lanzamiento de Gemini Robotics ER 2 marca el inicio de una nueva era en la que la inteligencia artificial abandona la exclusividad de las pantallas para tomar control efectivo del mundo físico.

La verdadera revolución de este modelo no radica solo en que los robots "vean" mejor, sino en que ahora poseen una capa de razonamiento superior que los hace conscientes de su propio progreso y de los agentes que los rodean. A medida que los desarrolladores comiencen a integrar APIs de control de bajo nivel con este nuevo cerebro organizador, veremos una adopción acelerada de robótica autónoma en sectores que van desde la logística avanzada hasta el trabajo colaborativo en entornos industriales.

La automatización ya no es solo cuestión de fuerza motriz; es, por fin, una cuestión de inteligencia adaptativa.