Ir para o conteúdo principal
Zubnet AIAprenderWiki › LLM como Juiz
Treinamento

LLM como Juiz

Também conhecido como: LLM-as-Judge, LLM Judge, LLM-as-a-Judge
Uma técnica de avaliação em que um modelo de linguagem grande atribui notas às saídas de outro modelo (ou às próprias), em vez de depender de avaliadores humanos. O juiz recebe o prompt original, uma ou duas respostas candidatas e uma rubrica de pontuação, e devolve uma nota, um veredito de preferência ou uma crítica. Tornou-se o método padrão para avaliar geração aberta, na qual métricas de sobreposição de strings como BLEU e ROUGE deixam de funcionar.

Por que isso importa

A avaliação humana é o padrão-ouro para julgar texto aberto, mas é lenta e cara: uma rodada séria de avaliação pode levar semanas e custar milhares de dólares. Um juiz LLM devolve milhares de julgamentos em minutos por poucos dólares, tornando prático avaliar toda mudança de prompt, troca de modelo e versão candidata. Também produz em escala os rótulos de preferência consumidos pelo treinamento moderno de alinhamento.

Em profundidade

A configuração tem três ingredientes: um prompt de teste, uma ou mais respostas candidatas e um prompt de julgamento que instrui o modelo avaliador sobre como dar a nota. Esse prompt normalmente inclui a entrada original, a saída candidata, uma resposta de referência opcional e uma rubrica — por exemplo, "avalie utilidade, precisão e clareza em uma escala de 1 a 5, explique seu raciocínio e então dê a pontuação final". Pedir ao juiz que raciocine antes de pontuar, em uma etapa de Cadeia de pensamento, melhora de forma consistente a concordância com avaliadores humanos em comparação com pedir apenas um número. Uma vez escrita a rubrica, a mesma chamada do juiz roda sobre centenas ou milhares de casos de teste por alguns centavos cada, o que torna a abordagem prática para Avaliação contínua por uma fração do custo da Anotação humana.

Pontuação Pairwise vs. Pointwise

Há duas configurações básicas. Na pontuação pointwise, o juiz vê uma resposta e a avalia contra a rubrica, geralmente em uma escala de 1 a 5 ou de 1 a 10; G-Eval, um framework inicial e influente de 2023, mostrou que conduzir o juiz pela rubrica passo a passo produz pontuações que acompanham avaliações humanas em tarefas de sumarização e diálogo. Na comparação pairwise, o juiz vê duas respostas ao mesmo prompt e escolhe uma vencedora, método usado pelo MT-Bench e pela maioria das avaliações automatizadas no estilo arena. Pairwise costuma ser mais confiável, porque escolher entre duas candidatas é uma tarefa mais fácil que calibrar uma nota absoluta e evita o problema de toda resposta acabar em 4 de 5. Pointwise, por outro lado, sai mais barato para avaliar a saída de um único sistema em escala, pois cada caso de teste requer apenas uma chamada ao juiz. A maioria dos pipelines de produção usa ambos: pontuações pointwise para acompanhar regressões, vereditos pairwise para comparações diretas entre modelos.

De Benchmarks a Loops de Treinamento

O mesmo mecanismo serve a três trabalhos diferentes. Primeiro, benchmarks: MT-Bench avalia respostas de chat em vários turnos com um modelo juiz forte e virou uma métrica padrão de ranking para qualidade de chat. Segundo, dados de treinamento: as preferências do juiz entre pares de respostas viram Dados Sintéticos de preferência que treinam um Modelo de Recompensa, o qual então alimenta otimização no estilo RLHF — esse pipeline é, essencialmente, o que significa RLAIF, e é assim que laboratórios escalam o aprendizado de preferências para além do que rotuladores humanos conseguem produzir. Terceiro, testes de regressão: equipes de produto mantêm um conjunto fixo de prompts de teste e julgam novamente as saídas a cada mudança de modelo ou prompt, capturando regressões de qualidade antes do lançamento. Nos três trabalhos, o juiz faz algo que humanos não conseguem executar em escala ou com consistência.

O Problema do Viés

Juízes LLM têm modos de falha documentados, e ignorá-los produz rankings inúteis. Viés de posição: muitos juízes favorecem a resposta que aparece primeiro (ou segundo), portanto pipelines sérios executam cada par nas duas ordens e mantêm apenas os vereditos que sobrevivem à troca. Viés de verbosidade: juízes preferem sistematicamente respostas mais longas e estruturadas mesmo quando o comprimento extra nada acrescenta, razão pela qual existem variantes de pontuação com controle de tamanho. Viés de autopreferência: um modelo usado como juiz tende a avaliar as saídas de sua própria família melhor do que um juiz independente faria, portanto as configurações mais seguras usam um modelo de família diferente daquela que está sendo avaliada. A formatação superficial também importa — títulos em markdown, listas de tópicos e um tom confiante empurram as notas para cima. Nada disso é fatal, mas significa que o prompt e o protocolo de julgamento importam tanto quanto o modelo juiz.

Ele Não Substituirá o Julgamento Humano

Um equívoco comum é que um juiz forte torna obsoleta a Avaliação Humana. A concordância observada entre os melhores modelos juízes e avaliadores humanos supera 80% em benchmarks como MT-Bench — aproximadamente o nível de concordância entre dois humanos —, mas essa é uma média, e a confiabilidade por exemplo é muito mais instável. Juízes são ruins em detectar uma Alucinação confiante e bem formatada, porque o texto soa bem e o juiz muitas vezes também não sabe a resposta correta. Também herdam seus próprios pontos cegos, portanto avaliações de alto risco — aconselhamento médico, automutilação, resistência a jailbreak — ainda exigem revisão humana, e afirmações de rankings devem ser conferidas contra votos de preferência humanos, como no Chatbot Arena. O enquadramento honesto: um juiz LLM é um proxy barato e ruidoso da preferência humana, excelente para ranquear e detectar regressões, não uma fonte de verdade fundamental.

Quando Confiar no Juiz

Como regra prática, o julgamento funciona melhor quando a qualidade depende de como algo é dito, não de estar exatamente certo: seguimento de instruções, tom, utilidade, fluência da sumarização, qualidade do chat. Funciona pior na fronteira factual, em que o juiz também não sabe a resposta, em domínios especializados nos quais o modelo juiz é fraco e em idiomas com poucos recursos. A higiene padrão é construir um pequeno conjunto-ouro com algumas centenas de exemplos rotulados por humanos, medir a concordância entre juiz e humano antes de escalar e revalidar sempre que o modelo juiz, a rubrica ou a distribuição de tarefas mudar. Equipes que pulam essa etapa acabam otimizando seus modelos para agradar ao juiz, não ao usuário — um modo de falha que aparece como modelos que escrevem respostas mais longas, mais enfeitadas e sutilmente piores.

← Todos os termos
ESC