LLM de Difusão
Por que isso importa
Em profundidade
Um modelo Autorregressivo escreve como uma pessoa digita: um token depois do outro, cada um condicionado a tudo o que veio antes, sem poder revisar o que já foi colocado. Um LLM de difusão funciona mais como um editor com um rascunho completo. O treinamento ensina o modelo a receber uma sequência em que alguns ou todos os tokens foram mascarados e prever os originais; assim, no momento da inferência, ele pode começar com uma tela inteiramente mascarada do comprimento desejado e preenchê-la ao longo de uma série de passagens, revelando ou corrigindo tokens até o texto convergir. Como todas as posições são atualizadas na mesma passagem forward, o modelo pode planejar toda a resposta de uma vez e usar contexto dos dois lados de cada token. A ideia é um transplante direto do processo de remoção de ruído por trás da tecnologia de Modelo de difusão para imagens, retrabalhado para um vocabulário discreto em vez de pixels contínuos.
Como Funciona o Ciclo de Remoção de Ruído
A maioria dos modelos de difusão de texto usa uma formulação mascarada (de estado absorvente), em vez do ruído gaussiano usado para imagens. Durante o treinamento, uma fração aleatória dos tokens em uma sequência limpa é substituída por um token especial de máscara, e o modelo aprende a prever o que foi escondido; a taxa de corrupção varia de poucos pontos percentuais à sequência inteira, em um primo ampliado do objetivo de Masked Language Modeling usado para treinar modelos encoder. Na geração, o modelo começa com uma tela inteiramente mascarada, prevê um Token candidato para cada posição mascarada em paralelo, confirma apenas aqueles nos quais está mais confiante e mascara novamente o restante para a etapa seguinte. Depois de algumas dezenas dessas etapas, a sequência fica completa. Uma variante prática comum é a decodificação semiautorregressiva: a tela é dividida em blocos gerados da esquerda para a direita, mas cada bloco é preenchido por remoção de ruído em paralelo, combinando o paralelismo da difusão com algumas das garantias de ordenação da geração clássica.
Por que a Matemática da Velocidade é Diferente
Um modelo autorregressivo precisa de uma passagem forward por token de saída, portanto uma resposta de 1.000 tokens significa 1.000 etapas sequenciais que não podem ser paralelizadas; o KV Cache mantém cada etapa barata, mas elas ainda acontecem uma depois da outra. Um LLM de difusão precisa de uma passagem forward por etapa de refinamento, e o número de etapas é um controle ajustável que não cresce com o comprimento da saída; assim, em princípio, uma resposta curta e uma longa têm Latência semelhante. A Inception Labs, startup por trás dos modelos Mercury, anuncia velocidades de geração acima de 1.000 tokens por segundo em GPUs padrão — número que vem desse paralelismo, não de hardware exótico. A contrapartida é que cada passagem recalcula a atenção sobre toda a tela e tira pouco proveito de cache, portanto a computação por passagem é maior, e a vantagem no mundo real aparece com mais clareza em serving voltado para Throughput, no qual muitas sequências podem ser refinadas em um batch.
Contexto Bidirecional e Preenchimento de Lacunas
Como não existe uma seta da esquerda para a direita na arquitetura, um LLM de difusão condiciona cada token a tudo ao redor, antes e depois. Isso torna o preenchimento de lacunas uma operação de primeira classe, não um modo especial: você pode entregar ao modelo um documento com o meio mascarado e pedir que regenere apenas esse trecho, mantenha fixo o texto ao redor ou revise iterativamente seu próprio rascunho. Essa linhagem remonta a modelos encoder como o BERT, que mostrou que a predição mascarada aprende representações bidirecionais fortes, mas nunca foi usado para geração aberta; de muitas maneiras, LLMs de difusão são a metade generativa que faltava a essa ideia. A mesma propriedade ajuda em tarefas nas quais o começo e o fim restringem o meio, como completar o corpo de uma função ou reescrever uma frase para caber em um template fixo.
Ele Ainda Não Substituirá Modelos Autorregressivos
Os números das demonstrações são reais, mas a distância para os modelos autorregressivos de fronteira ainda não foi fechada. Em Avaliação padrão, os melhores modelos de difusão ficam perto de modelos abertos fortes de tamanho semelhante, não no topo do ranking, e os truques que elevam a qualidade — mais etapas de refinamento, cronogramas mais pesados de remascaramento — consomem diretamente a vantagem de velocidade. O problema estrutural mais difícil é o comprimento: o modelo se compromete com um tamanho de tela antes de saber qual será a resposta, portanto precisa adivinhar quanto ela deve durar, preencher respostas curtas com padding ou encolher e fazer a tela crescer novamente durante a geração, tudo isso áreas de pesquisa ativa, não engenharia resolvida. A lacuna de ferramentas também importa: a pilha de serving, do vLLM às principais APIs de inferência, foi construída para decodificação da esquerda para a direita com cache de chave-valor, portanto modelos de difusão hoje rodam em infraestrutura sob medida que a maioria das equipes não pode simplesmente adotar.
Quem os Está Construindo
Três nomes ancoram o campo. LLaDA, de pesquisadores acadêmicos, mostrou que um modelo de difusão mascarada treinado do zero na escala de vários bilhões de parâmetros pode competir com modelos autorregressivos comparáveis em benchmarks de seguimento de instruções, e seu lançamento com pesos abertos deu à comunidade uma base para experimentos. Mercury, da Inception Labs, é o porta-estandarte comercial: uma família de modelos servidos por API, voltada para código e chat geral, que aposta pesadamente na história da velocidade. Gemini Diffusion é a entrada experimental do Google, posicionada como um modo de amostragem rápida ao lado de seus modelos principais. Sob o capô, boa parte do trabalho de arquitetura se apoia na pesquisa de Diffusion Transformer que modernizou a geração de imagens, e a maioria das equipes da área trata difusão não como substituta da modelagem autorregressiva, mas como um segundo paradigma de decodificação a manter na caixa de ferramentas.