LLM de diffusion
Pourquoi c’est important
En profondeur
Un modèle autorégressif écrit comme une personne tape : un token après l'autre, chacun conditionné par tout ce qui précède, sans moyen de réviser ce qui est déjà couché. Un modèle de diffusion textuelle fonctionne davantage comme un réviseur devant un brouillon complet. L'entraînement lui apprend à prendre une séquence dont certains ou tous les tokens ont été masqués et à prédire les originaux, de sorte qu'au moment de l'inférence il peut partir d'un canevas entièrement masqué de la longueur voulue et le remplir sur une série de passes, démasquant ou corrigeant des tokens jusqu'à ce que le texte converge. Comme chaque position est mise à jour dans la même passe avant, le modèle peut planifier toute la réponse d'un coup et utiliser le contexte des deux côtés de chaque token. L'idée est une transplantation directe du processus de débruitage derrière les modèles de diffusion d'images, retravaillé pour un vocabulaire discret plutôt que pour des pixels continus.
Comment fonctionne la boucle de débruitage
La plupart des modèles de diffusion textuelle utilisent une formulation masquée (à état absorbant) plutôt que le bruit gaussien employé pour les images. Pendant l'entraînement, une fraction aléatoire des tokens d'une séquence propre est remplacée par un token de masque spécial, et le modèle apprend à prédire ce qui était caché; le taux de corruption varie de quelques pour cent à la séquence entière, dans un cousin à grande échelle de l'objectif de modélisation de langage masquée qui sert à entraîner les modèles encodeurs. Au moment de la génération, le modèle part d'un canevas entièrement masqué, prédit un token candidat pour chaque position masquée en parallèle, puis ne fixe que les tokens dont il est le plus certain et remasque le reste pour l'étape suivante. Après quelques dizaines d'étapes de ce genre, la séquence est complète. Une variante pratique courante est le décodage semi-autorégressif : le canevas est divisé en blocs générés de gauche à droite, mais chaque bloc est rempli par débruitage parallèle, ce qui marie le parallélisme de la diffusion à une partie des garanties d'ordre de la génération classique.
Pourquoi le calcul de vitesse est différent
Un modèle autorégressif a besoin d'une passe avant par token de sortie, donc une réponse de 1 000 tokens veut dire 1 000 étapes séquentielles impossibles à paralléliser; le cache clé-valeur garde chaque étape peu coûteuse, mais les étapes se succèdent quand même une par une. Un modèle de diffusion textuelle a besoin d'une passe avant par étape de raffinement, et le nombre d'étapes est un cadran réglable qui ne croît pas avec la longueur de la sortie, donc en principe une réponse courte et une réponse longue coûtent une latence semblable. Inception Labs, la jeune pousse derrière les modèles Mercury, annonce des vitesses de génération dépassant 1 000 tokens par seconde sur des GPU standards — un chiffre qui vient de ce parallélisme plutôt que d'un matériel exotique. Le compromis, c'est que chaque passe recalcule l'attention sur tout le canevas et profite peu de la mise en cache, donc le calcul par passe est plus élevé, et l'avantage réel se manifeste surtout dans un service orienté débit, où de nombreuses séquences peuvent être raffinées par lot.
Contexte bidirectionnel et remplissage
Comme il n'y a pas de flèche gauche-droite dans l'architecture, un modèle de diffusion textuelle conditionne chaque token sur tout ce qui l'entoure, avant et après. Ça fait du remplissage une opération de premier plan plutôt qu'un mode spécial : vous pouvez donner au modèle un document dont le milieu est masqué et lui demander de régénérer seulement ce passage, de garder le texte environnant fixe, ou de réviser son propre brouillon de façon itérative. Cette lignée remonte aux modèles encodeurs comme BERT, qui ont montré que la prédiction masquée apprend de fortes représentations bidirectionnelles mais n'a jamais servi à la génération ouverte; les modèles de diffusion textuelle sont à bien des égards la moitié générative manquante de cette idée. La même propriété aide pour les tâches où le début et la fin contraignent le milieu, comme compléter le corps d'une fonction ou réécrire une phrase pour qu'elle entre dans un gabarit fixe.
Ils ne remplaceront pas encore les modèles autorégressifs
Les chiffres des démonstrations sont réels, mais l'écart avec les modèles autorégressifs de pointe ne s'est pas refermé. Sur les évaluations standards, les meilleurs modèles de diffusion se situent près des bons modèles ouverts de taille comparable plutôt qu'au sommet du classement, et les astuces qui font monter la qualité — plus d'étapes de raffinement, des calendriers de remasquage plus lourds — grugent directement l'avantage de vitesse. Le problème structurel plus difficile, c'est la longueur : le modèle s'engage sur une taille de canevas avant de savoir quelle sera la réponse, il doit donc deviner la longueur voulue, remplir les réponses courtes, ou rétrécir puis réétendre le canevas en cours de génération, autant de sujets de recherche actifs plutôt que d'ingénierie réglée. L'écart d'outillage compte aussi : la pile de service, de vLLM aux grandes API d'inférence, est bâtie autour du décodage de gauche à droite avec un cache clé-valeur, donc les modèles de diffusion tournent pour l'instant sur une infrastructure sur mesure que la plupart des équipes ne peuvent pas simplement adopter.
Qui les construit
Trois noms ancrent le domaine. LLaDA, issu de chercheurs universitaires, a montré qu'un modèle de diffusion masquée entraîné à partir de zéro à l'échelle de plusieurs milliards de paramètres peut tenir tête à des modèles autorégressifs comparables sur les bancs d'essai de suivi d'instructions, et sa publication en poids ouverts a donné à la communauté une base pour expérimenter. Mercury, d'Inception Labs, est le porte-étendard commercial : une famille de modèles servis par API, axés sur le code et la conversation générale, qui mise fort sur l'argument de la vitesse. Gemini Diffusion est l'entrée expérimentale de Google, positionnée comme un mode d'échantillonnage rapide à côté de ses modèles principaux. Sous le capot, une bonne partie du travail d'architecture s'appuie sur la recherche en diffusion transformer qui a modernisé la génération d'images, et la plupart des équipes du domaine voient la diffusion non pas comme un remplacement de la modélisation autorégressive, mais comme un second paradigme de décodage à garder dans le coffre à outils.