Diffusion LLM
为什么重要
深度解析
自回归模型的写法像人在打字:一个 token 接一个 token,每一步都以此前全部内容为条件,已经落下的字无法回头修改。Diffusion LLM 更像面对完整草稿的编辑。训练时,它学习接收一段部分或全部 token 被掩码的序列,并预测原文;到了推理阶段,模型就能从指定长度、完全被掩码的空白画布开始,经过一轮轮扫描填入内容,不断揭开或修正 token,直到文本收敛。因为所有位置会在同一次前向传播中更新,模型可以一次规划整个答案,并同时利用每个 token 两侧的上下文。这个思路直接移植自图像扩散模型背后的去噪过程,只是把连续像素改造成了离散词表。
去噪循环如何运作
大多数文本扩散模型采用掩码式的吸收状态方案,而不是图像所用的高斯噪声。训练时,干净序列中随机比例的 token 会被特殊掩码 token 替换,模型负责预测被藏起来的内容;破坏比例从几个百分点到整条序列不等,相当于把训练编码器模型时使用的掩码语言建模目标放大了一圈。生成时,模型从全掩码画布起步,并行预测每个掩码位置的候选 Token,然后只敲定最有把握的部分,把其余位置重新掩码,留到下一步。经过几十轮,序列便完整成形。一个常见的实用变体是半自回归解码:把画布分成从左到右依次生成的块,但每个块内部通过并行去噪填满,把扩散的并行性与经典生成方式的一部分顺序保证揉在一起。
速度这笔账为何不同
自回归模型每输出一个 token 就需要一次前向传播,所以一份 1000 token 的答案意味着 1000 个无法并行的串行步骤;KV缓存能让每一步都便宜些,但它们仍得一个接一个执行。Diffusion LLM 每轮精炼只需一次前向传播,轮数是可调旋钮,不会随输出长度增长,因此理论上,短答案与长答案的延迟相近。Mercury 模型背后的初创公司 Inception Labs 宣称,标准 GPU 上的生成速度可以超过每秒 1000 token——这个数字靠的是并行性,不是什么奇特硬件。代价是每一轮都要重新计算整张画布上的注意力,缓存几乎帮不上忙,单轮计算量因此更高;现实中的优势在面向Throughput的服务中最明显,因为这类服务可以成批精炼许多序列。
双向上下文与文本补全
由于架构里没有从左指向右的箭头,Diffusion LLM 会根据每个 token 前后周围的全部内容来预测它。因此,文本补全是一等操作,不是特殊模式:你可以交给模型一份中间被遮掉的文档,让它只重新生成那一段,同时固定周围文本,或是反复修改自己的草稿。这条技术脉络可以追溯到 BERT 等编码器模型;它们证明了掩码预测可以学到强大的双向表征,却从未被拿来做开放式生成。从许多角度看,Diffusion LLM 正是这个想法缺失已久的生成式另一半。开头和结尾共同约束中间内容的任务也会受益,例如补全函数体,或改写一句话以套进固定模板。
它暂时不会取代自回归模型
演示中的数字是真的,但它与前沿自回归模型之间的差距还没消失。在标准评估上,最好的扩散模型大致落在同等规模的强势开放模型附近,登不上排行榜顶端;而提升质量的手段——增加精炼步骤、采用更重的重新掩码调度——又会直接吃掉速度优势。更棘手的结构问题是长度:模型还不知道答案是什么,就得先承诺画布有多大,因此只能猜响应长度、给短答案补空白,或在生成途中缩小再扩张画布。这些仍是活跃研究方向,不是已经解决的工程问题。工具链的差距也很现实:从 vLLM 到主流推理 API,整套服务栈都是围绕带键值缓存的从左到右解码搭起来的;扩散模型目前得依赖定制基础设施,大多数团队没法拿来就用。
谁在做这件事
这个领域由三个名字坐镇。学术研究者推出的 LLaDA 证明,从零训练到数十亿参数规模的掩码扩散模型,可以在指令遵循基准上与同级自回归模型打得有来有回;开放权重发布又给了社区一个可供实验的底座。Inception Labs 的 Mercury 是商业旗手:这组通过 API 提供的模型专攻代码与通用聊天,把速度故事讲到了极致。Gemini Diffusion 则是 Google 的实验性选手,被定位成主线模型旁边的快速采样模式。底层的许多架构工作借鉴了曾推动图像生成现代化的 Diffusion Transformer 研究,而这一领域的大多数团队都不把扩散视为自回归建模的替代品,只是把它当作值得留在工具箱里的第二套解码范式。