SLM
為什麼重要
深度解析
這個標籤的界線持續變動,但實務上通常指約有 0.1B 至 15B 參數的模型——也就是任何能在工作站、手機或單張中階 GPU 上提供服務,而不需整個加速器機架的模型。SLM 之所以值得成為獨立類別,源於貫穿 2024 與 2025 年的一項轉變,有時概括為「小就是新的大」:實驗室不再只擴大模型規模,也開始投入大量心力,讓小型模型展現遠超其規模的能力。Microsoft 的 Phi 系列、Google 的 Gemma、Alibaba 較小型的 Qwen 版本,以及 Mistral 的 Ministral 3B 和 8B,都顯示只有前沿大型語言模型百分之一規模的模型,仍能處理相當比例的日常工作負載。結果形成兩層生態系:巨型模型處理困難的開放式問題,小型模型則處理其餘工作。
小模型如何變得這麼能幹
能力大幅躍升主要來自三項技術。第一是資料品質:Phi 產品線顯示,使用經過嚴格篩選、類似教科書的材料訓練,比未經整理的網路擷取資料更能讓小型模型從每個 token 學到知識,而這些材料如今有許多是由大型模型撰寫的Synthetic Data(合成資料)。第二是Distillation(蒸餾),將大型教師模型的輸出——有時甚至包括完整機率分布——作為訓練目標,讓學生模型吸收僅從文字無法學到的行為。第三是前沿模型採用的相同後訓練堆疊——指令微調與偏好最佳化——在小型規模下相對便宜,卻能大幅改善模型的實用程度。這三者結合後,現今訓練良好的 3B 模型可以勝過數年前規模大上許多倍的通用模型。
效率技術堆疊
原始參數量只說明了一半,另一半是讓小型模型能以低成本執行的工具。量化可將權重從 16-bit 浮點壓縮至 8-bit、甚至 4-bit 精確度,品質只有小幅下降;7–8B 模型因此可從約 16 GB 記憶體縮減至約 4–5 GB,3B 模型則只需約 2 GB。GGUF 等格式,以及 llama.cpp 與 Ollama 等執行環境,讓這整套流程可透過單一命令在一般 CPU 上完成,完全不需 GPU。同一套技術堆疊也能在手機與單板電腦上執行,讓裝置端助手——包括 Apple Intelligence 等功能背後的小型本機模型——從理論概念成為實際應用。
SLM 最能發揮價值之處
SLM 在正式環境中最有力的使用案例,是範圍狹窄且流量龐大的工作。對分類、實體擷取、路由、內容審核、短篇摘要與結構化解析等任務,經過微調的 1–8B 模型經常能達到以提示詞驅動之前沿模型的表現,每項請求的成本卻可能低數個數量級,回應速度也快得多。常見架構是串聯模式:小型模型處理 80–90% 的簡單流量,只將困難或意思不明確的查詢提升至大型模型,因此昂貴模型只承擔一小部分負載。
第二種使用案例是部署位置:讓模型在資料所在之處執行。裝置端推論代表使用者資料不會離開手機或企業網路,可簡化隱私審查與法規遵循,而且功能在完全沒有網路連線時仍能運作。這正是Edge AI(邊緣 AI)的核心理念:將智慧內建於裝置,而非向資料中心租用。經過微調的 SLM 也是團隊完全擁有的資產——權重儲存在磁碟上、不會在不知情下變更版本,也沒有隨成功規模成長的逐 token 帳單。
小不等於笨
常見的誤解會朝兩個方向發展,兩者都認為模型規模決定實用程度。一方面,現代 SLM 在標準基準測試上已勝過數年前的旗艦模型,因此將它們視為玩具早已過時。另一方面,限制確實存在:3B 模型擁有的世界知識遠少於 400B 模型,多步驟推理與細緻指令遵循能力也較弱,一旦超出實際掌握的知識範圍,就很容易產生幻覺。實用原則在於是否適合,而非規模大小:如果任務範圍狹窄,且能微調或約束輸出,SLM 通常是正確工具;如果任務開放且需要大量知識,就不適合。