跳到主要內容
Zubnet AI學習Wiki › SLM
基礎

SLM

別名:Small Language Model、Small Language Models、小語言模型
一種以效率為設計目標的語言模型,通常具有約 1 億至 150 億個參數。SLM 規模小到足以在筆記型電腦、手機或單張 GPU 等消費級硬體上執行,不需使用資料中心叢集;它以部分知識廣度與推理能力,換取低成本、低延遲,以及離線與裝置端執行能力。

為什麼重要

無法負擔按查詢計費的 API 帳單、雲端往返,或不能將使用者資料傳送給第三方的產品,可透過 SLM 內建 AI。對分類、擷取、短篇摘要與函式呼叫等範圍狹窄且定義明確的工作,經過微調的小型模型通常能以一小部分成本和延遲,達到前沿模型的表現。SLM 也能在資料所在的位置執行,這對隱私、法規遵循及離線使用十分重要。

深度解析

這個標籤的界線持續變動,但實務上通常指約有 0.1B 至 15B 參數的模型——也就是任何能在工作站、手機或單張中階 GPU 上提供服務,而不需整個加速器機架的模型。SLM 之所以值得成為獨立類別,源於貫穿 2024 與 2025 年的一項轉變,有時概括為「小就是新的大」:實驗室不再只擴大模型規模,也開始投入大量心力,讓小型模型展現遠超其規模的能力。Microsoft 的 Phi 系列、Google 的 Gemma、Alibaba 較小型的 Qwen 版本,以及 Mistral 的 Ministral 3B 和 8B,都顯示只有前沿大型語言模型百分之一規模的模型,仍能處理相當比例的日常工作負載。結果形成兩層生態系:巨型模型處理困難的開放式問題,小型模型則處理其餘工作。

小模型如何變得這麼能幹

能力大幅躍升主要來自三項技術。第一是資料品質:Phi 產品線顯示,使用經過嚴格篩選、類似教科書的材料訓練,比未經整理的網路擷取資料更能讓小型模型從每個 token 學到知識,而這些材料如今有許多是由大型模型撰寫的Synthetic Data(合成資料)。第二是Distillation(蒸餾),將大型教師模型的輸出——有時甚至包括完整機率分布——作為訓練目標,讓學生模型吸收僅從文字無法學到的行為。第三是前沿模型採用的相同後訓練堆疊——指令微調與偏好最佳化——在小型規模下相對便宜,卻能大幅改善模型的實用程度。這三者結合後,現今訓練良好的 3B 模型可以勝過數年前規模大上許多倍的通用模型。

效率技術堆疊

原始參數量只說明了一半,另一半是讓小型模型能以低成本執行的工具。量化可將權重從 16-bit 浮點壓縮至 8-bit、甚至 4-bit 精確度,品質只有小幅下降;7–8B 模型因此可從約 16 GB 記憶體縮減至約 4–5 GB,3B 模型則只需約 2 GB。GGUF 等格式,以及 llama.cpp 與 Ollama 等執行環境,讓這整套流程可透過單一命令在一般 CPU 上完成,完全不需 GPU。同一套技術堆疊也能在手機與單板電腦上執行,讓裝置端助手——包括 Apple Intelligence 等功能背後的小型本機模型——從理論概念成為實際應用。

SLM 最能發揮價值之處

SLM 在正式環境中最有力的使用案例,是範圍狹窄且流量龐大的工作。對分類、實體擷取、路由、內容審核、短篇摘要與結構化解析等任務,經過微調的 1–8B 模型經常能達到以提示詞驅動之前沿模型的表現,每項請求的成本卻可能低數個數量級,回應速度也快得多。常見架構是串聯模式:小型模型處理 80–90% 的簡單流量,只將困難或意思不明確的查詢提升至大型模型,因此昂貴模型只承擔一小部分負載。

第二種使用案例是部署位置:讓模型在資料所在之處執行。裝置端推論代表使用者資料不會離開手機或企業網路,可簡化隱私審查與法規遵循,而且功能在完全沒有網路連線時仍能運作。這正是Edge AI(邊緣 AI)的核心理念:將智慧內建於裝置,而非向資料中心租用。經過微調的 SLM 也是團隊完全擁有的資產——權重儲存在磁碟上、不會在不知情下變更版本,也沒有隨成功規模成長的逐 token 帳單。

小不等於笨

常見的誤解會朝兩個方向發展,兩者都認為模型規模決定實用程度。一方面,現代 SLM 在標準基準測試上已勝過數年前的旗艦模型,因此將它們視為玩具早已過時。另一方面,限制確實存在:3B 模型擁有的世界知識遠少於 400B 模型,多步驟推理與細緻指令遵循能力也較弱,一旦超出實際掌握的知識範圍,就很容易產生幻覺。實用原則在於是否適合,而非規模大小:如果任務範圍狹窄,且能微調或約束輸出,SLM 通常是正確工具;如果任務開放且需要大量知識,就不適合。

← 所有術語
ESC