La cifra que importa es 22: los grados de libertad de la mano SharpaWave de cinco dedos que el nuevo modelo de robótica de Google ya puede accionar en un cuerpo humanoide completo. En dos artículos publicados el 30 de julio, Google DeepMind presento Gemini Robotics 2, su primer modelo visión-lenguaje-acción que controla un humanoide entero, 'de los pies a las yemas de los dedos' en sus palabras, donde las versiones anteriores se limitaban a tareas de mesa con la parte superior del cuerpo. Demostrado en el Apollo 2 de Apptronik, el robot camina hasta una mesa, agarra una regadera, la lleva al otro lado de la habitación y la coloca en un estante, luego ata nudos y cierra una bolsa ziplock con la mano articulada; una plataforma Franka Duo hace empaquetado compacto con pinzas de dos dedos.
El segundo modelo es el que los desarrolladores pueden tocar de verdad. Gemini Robotics ER 2 es el cerebro de planificación: encadena tareas de varios pasos que duran minutos e implican lo que Google llama cientos de decisiones, corrige por si mismo los pasos fallidos, llama nativamente a herramientas como Google Search y se conecta a la API Gemini Live para streaming bidireccional. Está disponible públicamente desde hoy a través de la API de Gemini y Google AI Studio, con una vista previa privada en la Gemini Enterprise Agent Platform. Las evaluaciones propias de Google reclaman un 57,4 % de precisión en clasificación de progreso, un 91,3 % en localización de momentos con 0,96 segundos de distancia absoluta media, a cuatro veces la velocidad de ejecución de modelos mucho mayores, y lee instrumentos de 10 tipos, de pantallas digitales a termometros de líquido.
Un tercer modelo, Gemini Robotics On-Device 2, funciona localmente y se adapta a lo que Google llama cuerpos de robot completamente nuevos en pocas horas, típicamente con menos de 200 ejemplos, demostrado en el hardware de Dexmate, SO101 y Trossen. Las demos multirobot emparejan a Apollo 2 con un Franka F3 Duo, y otra muestra a ER 2 orquestando las API del Spot de Boston Dynamics para traer un tentempie por orden de voz, con el código en GitHub. Los socios nombrados son Apptronik, Boston Dynamics y Agile Robots. En seguridad, Google público un nuevo benchmark ASIMOV-Agentic para llamadas a herramientas inseguras y petición de intervención humana, y dice que ER 2 detiene a un humanoide cuando una persona se acerca y reanuda cuando el paso está libre.
Las salvedades son estructurales. Cada benchmark citado arriba es una evaluación realizada por Google, y las demostraciones mostradas a los periodistas, incluida WIRED, eran videos pregrabados, no ejecuciones en vivo. El reparto de disponibilidad también recorta el anuncio a su tamaño real: de los tres modelos, sólo ER 2 es accesible al público, mientras Robotics 2 y On-Device 2 siguen limitados a socios de acceso anticipado. Carolina Parada, jefa de robótica de DeepMind, presenta el lanzamiento como un hito hacia la 'AGI fisica'. La lectura más discreta es más útil para quienes construyen: el control de robots se está convirtiendo en una linea de la misma factura de API que la generación de texto, y la pregunta abierta se desplaza de si el modelo puede mover el brazo a quien tiene permiso para ejecutarlo, y bajo que expediente de seguridad.
