跳到主要内容
Zubnet AI学习Wiki › Diffusion LLM
模型

Diffusion LLM

别名:Text Diffusion Model、dLLM、文本扩散模型
一种通过迭代去噪来生成文本的大型语言模型,不再从左到右一次预测一个 token。它从完全被掩码或破坏的序列起步,用少量步骤并行精炼每一个位置,把图像扩散模型的核心思路改造成适合离散文本的版本。

为什么重要

速度是头号卖点:延迟随精炼步数而变,不随答案长度而变,因此长回答不必按比例多花时间。Diffusion LLM 还能同时看到两个方向的上下文,天生擅长补全、编辑和修改已有文本,而不只会接着往下写。

深度解析

自回归模型的写法像人在打字:一个 token 接一个 token,每一步都以此前全部内容为条件,已经落下的字无法回头修改。Diffusion LLM 更像面对完整草稿的编辑。训练时,它学习接收一段部分或全部 token 被掩码的序列,并预测原文;到了推理阶段,模型就能从指定长度、完全被掩码的空白画布开始,经过一轮轮扫描填入内容,不断揭开或修正 token,直到文本收敛。因为所有位置会在同一次前向传播中更新,模型可以一次规划整个答案,并同时利用每个 token 两侧的上下文。这个思路直接移植自图像扩散模型背后的去噪过程,只是把连续像素改造成了离散词表。

去噪循环如何运作

大多数文本扩散模型采用掩码式的吸收状态方案,而不是图像所用的高斯噪声。训练时,干净序列中随机比例的 token 会被特殊掩码 token 替换,模型负责预测被藏起来的内容;破坏比例从几个百分点到整条序列不等,相当于把训练编码器模型时使用的掩码语言建模目标放大了一圈。生成时,模型从全掩码画布起步,并行预测每个掩码位置的候选 Token,然后只敲定最有把握的部分,把其余位置重新掩码,留到下一步。经过几十轮,序列便完整成形。一个常见的实用变体是半自回归解码:把画布分成从左到右依次生成的块,但每个块内部通过并行去噪填满,把扩散的并行性与经典生成方式的一部分顺序保证揉在一起。

速度这笔账为何不同

自回归模型每输出一个 token 就需要一次前向传播,所以一份 1000 token 的答案意味着 1000 个无法并行的串行步骤;KV缓存能让每一步都便宜些,但它们仍得一个接一个执行。Diffusion LLM 每轮精炼只需一次前向传播,轮数是可调旋钮,不会随输出长度增长,因此理论上,短答案与长答案的延迟相近。Mercury 模型背后的初创公司 Inception Labs 宣称,标准 GPU 上的生成速度可以超过每秒 1000 token——这个数字靠的是并行性,不是什么奇特硬件。代价是每一轮都要重新计算整张画布上的注意力,缓存几乎帮不上忙,单轮计算量因此更高;现实中的优势在面向Throughput的服务中最明显,因为这类服务可以成批精炼许多序列。

双向上下文与文本补全

由于架构里没有从左指向右的箭头,Diffusion LLM 会根据每个 token 前后周围的全部内容来预测它。因此,文本补全是一等操作,不是特殊模式:你可以交给模型一份中间被遮掉的文档,让它只重新生成那一段,同时固定周围文本,或是反复修改自己的草稿。这条技术脉络可以追溯到 BERT 等编码器模型;它们证明了掩码预测可以学到强大的双向表征,却从未被拿来做开放式生成。从许多角度看,Diffusion LLM 正是这个想法缺失已久的生成式另一半。开头和结尾共同约束中间内容的任务也会受益,例如补全函数体,或改写一句话以套进固定模板。

它暂时不会取代自回归模型

演示中的数字是真的,但它与前沿自回归模型之间的差距还没消失。在标准评估上,最好的扩散模型大致落在同等规模的强势开放模型附近,登不上排行榜顶端;而提升质量的手段——增加精炼步骤、采用更重的重新掩码调度——又会直接吃掉速度优势。更棘手的结构问题是长度:模型还不知道答案是什么,就得先承诺画布有多大,因此只能猜响应长度、给短答案补空白,或在生成途中缩小再扩张画布。这些仍是活跃研究方向,不是已经解决的工程问题。工具链的差距也很现实:从 vLLM 到主流推理 API,整套服务栈都是围绕带键值缓存的从左到右解码搭起来的;扩散模型目前得依赖定制基础设施,大多数团队没法拿来就用。

谁在做这件事

这个领域由三个名字坐镇。学术研究者推出的 LLaDA 证明,从零训练到数十亿参数规模的掩码扩散模型,可以在指令遵循基准上与同级自回归模型打得有来有回;开放权重发布又给了社区一个可供实验的底座。Inception Labs 的 Mercury 是商业旗手:这组通过 API 提供的模型专攻代码与通用聊天,把速度故事讲到了极致。Gemini Diffusion 则是 Google 的实验性选手,被定位成主线模型旁边的快速采样模式。底层的许多架构工作借鉴了曾推动图像生成现代化的 Diffusion Transformer 研究,而这一领域的大多数团队都不把扩散视为自回归建模的替代品,只是把它当作值得留在工具箱里的第二套解码范式。

← 所有术语
ESC