A Galaxy Universal Robotics, uma empresa chinesa de robótica humanoide, abriu o código do AstraBrain-WBC 0.5, um modelo de base que ela descreve como um cerebelo de propósito geral para robos humanoides. Enquanto o cérebro de um robô cuida do planejamento de alto nível, o cerebelo e a camada que de fato move o corpo, e este coordena o movimento de corpo inteiro em tempo real ao longo de 29 graus de liberdade, mantendo a máquina equilibrada. A empresa o chama de primeiro modelo de controle em tempo real de corpo inteiro para humanoides a funcionar nesta escala de parâmetros, e o número e a surpresa: 80,4 milhões de parâmetros, pequeno o suficiente para rodar em menos de 1.5 milissegundos numa única RTX 4090.
O modelo foi treinado com o que a empresa diz ser o maior conjunto de dados de movimento humano de seu tipo, cerca de 2 bilhões de quadros cobrindo aproximadamente 20,000 horas de movimento. Os dados abrangem danca, esportes, comportamento cotidiano, operações industriais e transporte colaborativo em dupla, com a ideia de que um controlador exposto a essa amplitude de movimento humano aprende princípios gerais de mover um corpo, em vez de uma lista fixa de rotinas.
O resultado principal e a generalização zero-shot. A empresa mostra o modelo executando ações complexas que não estavam em seus dados de treinamento, incluindo movimentos de basquete, boxe, danca, cambalhotas e transporte coordenado com um parceiro, sem ser retreinado para nenhuma delas. De ponta a ponta, da captura de movimento ate o robô, o pipeline roda em menos de 20 milissegundos. Generalizar para movimentos nunca vistos e a parte dificil do controle de humanoides, em que a maioria dos sistemas e ajustada habilidade por habilidade, de modo que um único modelo improvisando novas ações de corpo inteiro e a afirmação que vale a pena acompanhar.
O que o torna mais do que uma demonstração e que o artigo, o código e os resultados estão totalmente abertos. Isso e o oposto da direção predominante, na qual os modelos de base robóticos mais capazes são proprietários e atrelados a uma plataforma especifica, e significa que pesquisadores externos podem de fato testar se as afirmações de zero-shot se sustentam em seu próprio hardware. Um modelo pequeno que roda numa única GPU de consumo também reduz a barreira para colocar controle capaz num robô real, em vez de num servidor.
As ressalvas são as de sempre para um lançamento como este. Os números e o enquadramento de pioneirismo mundial vem do anuncio da própria empresa, as demonstracoes são selecionadas, e o quanto resultados de ambiente controlado se transferem para tarefas confusas do mundo real e exatamente o que a reprodução vai decidir. Mas o formato da aposta e a parte interessante, e ele vai contra o momento: não um cérebro proprietário gigantesco, mas um controlador pequeno, eficiente e aberto que qualquer um pode baixar e experimentar. Se a generalização zero-shot se confirmar, fazer mais do movimento robótico com menos parâmetros e uma direção mais útil do que faze-lo com mais.
