Ir para o conteúdo principal
Zubnet AIAprenderWiki › GRPO
Treinamento

GRPO

Também conhecido como: Group Relative Policy Optimization
Um algoritmo de aprendizado por reforço para ajuste fino de modelos de linguagem, introduzido pela DeepSeek em 2024 e popularizado pelo DeepSeek-R1. Em vez de treinar um modelo de valor separado para julgar as saídas, ele amostra um grupo de respostas candidatas por prompt e pontua cada uma em relação à recompensa média do grupo. Isso torna o aprendizado por reforço mais barato e simples de executar, e ele se tornou uma escolha padrão para o pós-treinamento de modelos de raciocínio em tarefas com recompensas verificáveis.

Por que isso importa

O GRPO cortou o custo do ajuste fino por RL ao eliminar o modelo crítico, um dos dois modelos grandes que os pipelines clássicos precisavam treinar e manter em memória, colocando o treinamento no estilo raciocínio ao alcance de equipes sem infraestrutura de laboratório de fronteira. É o algoritmo por trás do DeepSeek-R1 e da maioria dos modelos de raciocínio abertos desde então, então aparece hoje em quase toda stack séria de pós-treinamento. Se um modelo que você usa foi treinado para resolver problemas de matemática, código ou lógica, há uma boa chance de o GRPO estar envolvido.

Em profundidade

O GRPO — Group Relative Policy Optimization — apareceu primeiro no artigo DeepSeekMath da DeepSeek em 2024, e ficou famoso um ano depois como o algoritmo de treinamento por trás do DeepSeek-R1, o modelo aberto que mostrou que o aprendizado por reforço sozinho podia elicitar cadeias de pensamento longas e autoverificadas. Em sua essência, é uma simplificação pragmática do PPO, o algoritmo que alimentava os pipelines clássicos de RLHF. O PPO treina um segundo modelo grande, o crítico, para estimar quão boa é uma resposta parcialmente gerada; o GRPO joga o crítico fora. Para cada prompt, a política atual amostra um grupo de saídas candidatas, cada saída recebe uma recompensa, e a vantagem de cada uma é simplesmente o quanto sua recompensa fica acima ou abaixo da média do grupo. O resultado é um loop de RL mais barato de executar, mais fácil de ajustar e um encaixe natural para as recompensas verificáveis usadas para treinar modelos de raciocínio.

Como o Grupo Substitui o Crítico

No PPO, o trabalho do crítico é prever a recompensa esperada de uma resposta parcial para que o algoritmo saiba se o resultado final foi melhor ou pior que o esperado. O GRPO obtém o mesmo sinal de linha de base a partir de estatística, em vez de uma rede neural. Dado um prompt, a política gera um grupo de G saídas — de 8 a 64 na prática — e cada saída é pontuada, seja por um verificador baseado em regras (a resposta de matemática bateu, o código passou nos testes) ou por um modelo de recompensa aprendido. A vantagem de cada saída é então sua recompensa menos a média do grupo, dividida pelo desvio padrão do grupo. Saídas acima da média do grupo têm sua probabilidade aumentada, saídas abaixo dela são empurradas para baixo, e um objetivo clipado no estilo PPO mais uma penalidade KL em direção a um modelo de referência congelado mantém cada atualização pequena. Como a linha de base é computada por prompt, prompts em que todas as amostras pontuam igual contribuem com quase nenhum gradiente, o que se revela muito importante na prática.

Por Que É Mais Barato e Mais Estável

A economia é concreta. Os pipelines clássicos de PPO mantêm quatro modelos em memória durante o treinamento — a política, uma política de referência congelada, um modelo de recompensa e um crítico que costuma ser tão grande quanto a própria política — e o crítico precisa ser treinado junto com todo o resto, o que é notoriamente temperamental. O GRPO remove o mais problemático dos quatro, liberando VRAM para batches maiores ou modelos maiores e eliminando toda uma classe de bugs de aprendizado de valor. A normalização por grupo também lida com a escala de recompensa automaticamente: um prompt cujas recompensas estão fortemente agrupadas tem suas vantagens comprimidas em direção a zero, então a atualização se concentra em prompts em que as saídas do modelo realmente diferem em qualidade. O trade-off é que o orçamento de computação migra do treinamento do crítico para a inferência: gerar 16 ou 32 amostras por prompt ao longo de milhares de prompts por passo significa que o amostrador, não o otimizador, costuma ser o gargalo.

É um Otimizador, Não uma Receita de Raciocínio

Um equívoco comum é que o GRPO é inerentemente ligado a raciocínio ou a recompensas verificáveis — que o algoritmo em si produziu o comportamento visto no DeepSeek-R1. Não é. O GRPO é agnóstico de recompensa: ele maximiza alegremente qualquer sinal que receba, incluindo um modelo de recompensa aprendido pontuando qualidades abertas como utilidade ou estilo. O avanço do raciocínio veio da combinação — GRPO mais recompensas verificáveis baseadas em regras, mais um modelo base forte, mais execuções de treinamento longas o suficiente para que comportamentos como autoverificação emergissem — a receita hoje descrita como RLVR. Inversamente, recompensas verificáveis funcionam bem com PPO puro, e vários laboratórios treinaram modelos de raciocínio assim antes de o GRPO existir. Manter as duas ideias separadas importa na prática: equipes que adotam o GRPO esperando que o raciocínio emerja só do algoritmo, sem recompensas cuidadosamente desenhadas e computação suficiente, geralmente se decepcionam.

Onde Ele Quebra

A elegância do GRPO vem com modos de falha que valem conhecer. O mais discutido é o grupo tudo-ou-nada: quando todas as amostras de um prompt recebem a mesma recompensa — todas corretas ou todas erradas — toda vantagem é zero e o prompt não contribui nada, então o sinal de treinamento depende fortemente de manter a dificuldade dos prompts na faixa em que o modelo acerta às vezes. A esparsidade de recompensa piora isso em tarefas difíceis, e é por isso que pipelines práticos misturam problemas mais fáceis ou usam crédito parcial. Grupos pequenos dão linhas de base ruidosas; grupos grandes custam mais computação de amostragem, e o tamanho certo ainda é questão de ajuste empírico. Em execuções longas, os modelos também podem sofrer colapso de entropia, em que a política fica confiante demais cedo demais e para de explorar, ou inflação de comprimento, em que as respostas ficam mais longas porque o comprimento por acaso se correlaciona com a recompensa. A maioria desses problemas tem mitigações, e implementações em frameworks como o TRL do Hugging Face expõem os botões relevantes, mas o GRPO não é um algoritmo de ligar e esquecer.

← Todos os termos
ESC