Galaxy Universal Robotics, una empresa china de robótica humanoide, ha liberado como código abierto AstraBrain-WBC 0.5, un modelo fundacional que describe como un cerebelo de propósito general para robots humanoides. Mientras que el cerebro de un robot se encarga de la planificación de alto nivel, el cerebelo es la capa que realmente mueve el cuerpo, y este coordina el movimiento de cuerpo completo en tiempo real a través de 29 degrees of freedom mientras mantiene la máquina equilibrada. La empresa lo califica como el primer modelo de control en tiempo real de cuerpo completo para humanoides que funciona a esta escala de parámetros, y el número es la sorpresa: 80,4 millones de parámetros, lo bastante pequeño para ejecutarse en menos de 1.5 milliseconds en una sola RTX 4090.
El modelo fue entrenado con lo que la empresa dice que es el mayor conjunto de datos de movimiento humano de su tipo, aproximadamente 2 mil millones de fotogramas que cubren unas 20,000 hours de movimiento. Los datos abarcan danza, deportes, comportamiento cotidiano, operaciones industriales y transporte colaborativo entre dos personas, con la idea de que un controlador expuesto a ese rango de movimiento humano aprende principios generales de cómo mover un cuerpo en lugar de una lista fija de rutinas.
El resultado estrella es la generalización zero-shot. La empresa muestra el modelo ejecutando acciones complejas que no estaban en sus datos de entrenamiento, incluidos movimientos de baloncesto, boxeo, danza, volteretas y transporte coordinado con un compañero, sin volver a entrenarse para ninguna de ellas. De principio a fin, desde la captura de movimiento hasta el robot, la canalización se ejecuta en menos de 20 milliseconds. Generalizar a movimientos no vistos es la parte difícil del control de humanoides, donde la mayoría de los sistemas se ajustan habilidad por habilidad, así que un solo modelo improvisando nuevas acciones de cuerpo completo es la afirmación que vale la pena vigilar.
Lo que lo hace más que una demostración es que el artículo, el código y los resultados están totalmente liberados como código abierto. Eso es lo contrario de la dirección predominante, donde los modelos fundacionales robóticos más capaces son propietarios y están atados a una plataforma específica, y significa que investigadores externos pueden de verdad comprobar si las afirmaciones zero-shot se sostienen en su propio hardware. Un modelo pequeño que se ejecuta en una sola GPU de consumo también reduce la barrera para poner un control capaz en un robot real en lugar de en un servidor.
Las advertencias son las habituales para un lanzamiento como este. Los números y el marco de primicia mundial provienen del propio anuncio de la empresa, las demostraciones están curadas, y que tan bien se trasladan los resultados de entornos controlados a las tareas desordenadas del mundo real es exactamente lo que decidirá la reproducción. Pero la forma de la apuesta es la parte interesante, y va contra el momento: no un cerebro propietario gigantesco, sino un controlador pequeño, eficiente y abierto que cualquiera puede descargar y probar. Si la generalización zero-shot se sostiene, hacer más del movimiento robótico con menos parámetros es una dirección más útil que hacerlo con más.
