LLM de difusión
Por qué importa
En profundidad
Un modelo Autoregresivo escribe como una persona teclea: un token después de otro, cada uno condicionado por todo lo anterior y sin posibilidad de revisar lo que ya quedó escrito. Un LLM de difusión funciona más como un editor con un borrador completo. El entrenamiento le enseña a tomar una secuencia en la que algunos o todos los tokens están enmascarados y predecir los originales, de modo que durante la inferencia puede partir de un lienzo completamente enmascarado con la longitud deseada y rellenarlo a lo largo de una serie de pasadas, desenmascarando o corrigiendo tokens hasta que el texto converge. Como cada posición se actualiza en la misma pasada hacia adelante, el modelo puede planificar toda la respuesta de una vez y usar el contexto de ambos lados de cada token. La idea es un trasplante directo del proceso de eliminación de ruido detrás del Modelo de difusión para imágenes, reelaborado para un vocabulario discreto en lugar de píxeles continuos.
Cómo funciona el bucle de eliminación de ruido
La mayoría de los modelos de difusión de texto usa una formulación enmascarada (de estado absorbente) en lugar del ruido gaussiano utilizado para las imágenes. Durante el entrenamiento, una fracción aleatoria de los tokens de una secuencia limpia se sustituye por un token especial de máscara, y el modelo aprende a predecir qué se ocultó; la tasa de alteración varía desde unos pocos puntos porcentuales hasta la secuencia completa, como un primo a mayor escala del objetivo de Modelado de lenguaje enmascarado utilizado para entrenar modelos encoder. En el momento de la generación, el modelo parte de un lienzo totalmente enmascarado, predice un Token candidato para cada posición enmascarada en paralelo, confirma únicamente los tokens en los que tiene mayor confianza y vuelve a enmascarar el resto para el paso siguiente. Tras unas decenas de pasos de este tipo, la secuencia está completa. Una variante práctica común es la decodificación semiautoregresiva: el lienzo se divide en bloques que se generan de izquierda a derecha, pero cada bloque se rellena mediante eliminación de ruido en paralelo, mezclando el paralelismo de la difusión con algunas de las garantías de orden de la generación clásica.
Por qué las cuentas de velocidad son distintas
Un modelo autoregresivo necesita una pasada hacia adelante por cada token de salida, así que una respuesta de 1.000 tokens implica 1.000 pasos secuenciales que no pueden paralelizarse; la KV Cache mantiene barato cada paso, pero los pasos siguen ocurriendo uno después de otro. Un LLM de difusión necesita una pasada hacia adelante por cada paso de refinamiento, y la cantidad de pasos es un control ajustable que no crece con la longitud de salida, por lo que, en principio, una respuesta corta y una larga tienen una Latencia similar. Inception Labs, la startup detrás de los modelos Mercury, anuncia velocidades de generación superiores a 1.000 tokens por segundo en GPU estándar — una cifra que procede de este paralelismo y no de hardware exótico. La contrapartida es que cada pasada vuelve a calcular la atención sobre todo el lienzo y obtiene poco beneficio del caching, así que el cómputo por pasada es mayor y la ventaja en el mundo real aparece con más claridad al servir con énfasis en el Rendimiento, donde muchas secuencias pueden refinarse en un batch.
Contexto bidireccional y completado de huecos
Como la arquitectura no tiene una flecha de izquierda a derecha, un LLM de difusión condiciona cada token a todo lo que lo rodea, tanto antes como después. Eso convierte el completado de huecos en una operación de primera clase y no en un modo especial: puedes entregar al modelo un documento con el centro enmascarado y pedirle que regenere únicamente ese tramo, mantener fijo el texto circundante o revisar iterativamente su propio borrador. Este linaje se remonta a modelos encoder como BERT, que demostró que la predicción enmascarada aprende representaciones bidireccionales sólidas, pero nunca se utilizó para generación abierta; en muchos sentidos, los LLM de difusión son la mitad generativa que le faltaba a esa idea. La misma propiedad ayuda con tareas en las que el principio y el final limitan el centro, como completar el cuerpo de una función o reescribir una oración para que encaje en una plantilla fija.
Todavía no sustituirá a los modelos autoregresivos
Las cifras de las demostraciones son reales, pero la brecha respecto de los modelos autoregresivos de frontera no se ha cerrado. En pruebas de Evaluación estándar, los mejores modelos de difusión se sitúan cerca de modelos abiertos sólidos de tamaño similar, en vez de encabezar el leaderboard, y los trucos que elevan la calidad — más pasos de refinamiento, programas de reenmascarado más intensos — se comen directamente la ventaja de velocidad. El problema estructural más difícil es la longitud: el modelo se compromete con un tamaño de lienzo antes de saber cuál es la respuesta, así que debe adivinar cuánto debería medir, rellenar las respuestas cortas o encoger y volver a ampliar el lienzo durante la generación; todos ellos son campos de investigación activa y no problemas de ingeniería resueltos. La brecha en las herramientas también importa: la pila para servir modelos, desde vLLM hasta las principales API de inferencia, está construida alrededor de la decodificación de izquierda a derecha con una caché de claves y valores, por lo que los modelos de difusión se ejecutan actualmente en infraestructura hecha a la medida que la mayoría de los equipos no puede adoptar sin más.
Quién los está construyendo
Tres nombres son los referentes del campo. LLaDA, de investigadores académicos, demostró que un modelo de difusión enmascarado entrenado desde cero a una escala de varios miles de millones de parámetros puede competir con modelos autoregresivos comparables en benchmarks de seguimiento de instrucciones, y su publicación con pesos abiertos dio a la comunidad una base para experimentar. Mercury, de Inception Labs, es el exponente comercial: una familia de modelos servidos mediante API y centrados en código y chat general que apuesta con fuerza por la velocidad. Gemini Diffusion es la propuesta experimental de Google, presentada como un modo de muestreo rápido junto a sus modelos principales. Bajo el capó, buena parte del trabajo de arquitectura se nutre de la investigación sobre Diffusion Transformer que modernizó la generación de imágenes, y la mayoría de los equipos del área trata la difusión no como sustituto del modelado autoregresivo, sino como un segundo paradigma de decodificación que conviene guardar en la caja de herramientas.