跳到主要內容
Zubnet AI學習Wiki › Diffusion LLM
模型

Diffusion LLM

別名:Text Diffusion Model、dLLM、文字擴散模型
一種透過反覆去除雜訊來生成文字的大型語言模型,不再由左至右、一次預測一個 token。它從完全被遮罩或擾動的序列開始,經少量步驟並行精修每個位置,將圖像擴散模型的核心概念改造成適合離散文字的版本。

為什麼重要

速度是最大賣點:延遲取決於精修步數,而非答案長度,因此生成較長的回答不必按比例花費更多時間。Diffusion LLM 還能同時查看雙向上下文,天生擅長填補、編輯與修改既有文字,而不只會接著向下撰寫。

深度解析

Autoregressive(自回歸)模型的寫作方式就像人類打字:一個 token 接一個 token,每一步都以前面的全部內容為條件,已經寫下的字無法回頭修改。Diffusion LLM 則更像一位面對完整草稿的編輯。訓練時,它會學習接收一段部分或全部 token 遭遮罩的序列,並預測原文;到了推論階段,模型便能從指定長度、完全被遮罩的空白畫布開始,經過一輪又一輪的掃描填入內容,不斷揭開或修正 token,直到文字收斂。由於所有位置都會在同一次前向傳播中更新,模型可以一次規劃整個答案,並同時利用每個 token 兩側的上下文。這項概念直接移植自圖像擴散模型背後的去雜訊過程,只是將連續像素改造成離散詞彙表。

去雜訊循環如何運作

大多數文字擴散模型採用遮罩式的吸收狀態方案,而不是圖像所使用的高斯雜訊。訓練時,乾淨序列中隨機比例的 token 會被特殊遮罩 token 取代,模型負責預測遭隱藏的內容;擾動比例從幾個百分點到整段序列不等,相當於將訓練編碼器模型時所用的遮罩語言建模目標放大。生成時,模型從全遮罩畫布開始,並行預測每個遮罩位置的候選 Token,接著只確定最有把握的部分,再將其餘位置重新遮罩,留待下一步處理。經過數十輪,序列便完整成形。一個常見的實用變體是半自回歸解碼:將畫布切成由左至右依序生成的區塊,但每個區塊內部透過並行去雜訊填滿,把擴散的並行性與傳統生成方式的部分順序保證結合起來。

速度這筆帳為何不同

自回歸模型每輸出一個 token,就需要執行一次前向傳播,因此一份含 1,000 個 token 的答案,代表要經過 1,000 個無法並行的循序步驟;KV Cache(KV 快取)能降低每一步的成本,但這些步驟仍須逐一執行。Diffusion LLM 每輪精修只需一次前向傳播,輪數是一項可調參數,不會隨輸出長度增加;因此理論上,短答案與長答案的延遲相近。Mercury 模型背後的新創公司 Inception Labs 宣稱,使用標準 GPU 時,生成速度可超過每秒 1,000 個 token——這項數字來自並行處理,而非特殊硬體。代價是每一輪都得重新計算整張畫布上的注意力,快取幾乎派不上用場,因而提高每輪運算量;在講求Throughput的服務情境中,實際優勢最為明顯,因為這類服務可批次精修許多序列。

雙向上下文與文字填補

由於架構中沒有由左指向右的箭頭,Diffusion LLM 會根據每個 token 前後的全部內容進行預測。因此,文字填補是第一級操作,而非特殊模式:你可以交給模型一份中間遭遮罩的文件,要求它只重新生成該段內容,同時保持周圍文字不變,或讓它反覆修改自己的草稿。這條技術脈絡可追溯至 BERT 等編碼器模型;它們證明遮罩預測能學到強大的雙向表徵,卻從未用於開放式生成。從許多角度來看,Diffusion LLM 正是這項構想長久缺少的生成式另一半。開頭與結尾共同限制中間內容的任務也會受益,例如填補函式主體,或改寫一句話以符合固定範本。

它暫時不會取代自回歸模型

示範中的數字確實不假,但它與前沿自回歸模型之間的差距尚未消失。在標準評估中,最好的擴散模型大致接近同等規模的強大開放模型,而非排行榜頂端;提升品質的方法——增加精修步驟、採用更繁重的重新遮罩排程——又會直接侵蝕速度優勢。更棘手的結構性問題是長度:模型尚不知道答案內容,就得先決定畫布有多大,因此只能猜測回應長度、替較短答案補上空白,或在生成途中縮小再擴張畫布。這些仍是活躍的研究方向,而非已經解決的工程問題。工具鏈的差距也很實際:從 vLLM 到主流推論 API,整套服務堆疊都是圍繞具有鍵值快取的由左至右解碼所建構;擴散模型目前必須仰賴專用基礎設施,多數團隊無法直接採用。

誰在做這件事

這個領域由三個名字支撐。學術研究人員推出的 LLaDA 證明,從零開始訓練、規模達數十億參數的遮罩擴散模型,可以在指令遵循基準測試上與同級自回歸模型分庭抗禮;以開放權重釋出,也為社群提供一個可供實驗的基礎。Inception Labs 的 Mercury 是商業代表:這組透過 API 提供的模型專攻程式碼與一般聊天,將速度優勢發揮到極致。Gemini Diffusion 則是 Google 的實驗性產品,定位為主要模型旁的快速取樣模式。底層許多架構工作,借鏡了推動圖像生成現代化的 Diffusion Transformer 研究;這個領域的多數團隊並不將擴散視為自回歸建模的替代方案,而是把它當成值得留在工具箱中的第二套解碼範式。

← 所有術語
ESC