Phi
為什麼重要
深度解析
Phi 是 Microsoft 自行研發的小型語言模型家族,用來驗證一項特定假設:若模型以極為乾淨、以教學為導向的資料訓練,其推理能力便能媲美以原始網頁文字訓練、規模大得多的模型。該系列始於 2023 年的 Phi-1——一個擁有 13 億參數的程式碼模型——隨後經 Phi-2、Phi-3 和 Phi-4 發展成涵蓋約 10 億至 140 億參數的產品線,其中包括多模態與專家混合模型變體。近期版本全都依 MIT 授權條款釋出開放權重,可免費下載、微調並用於商業部署。在業界,Phi 已成為 SLM 類別的指標性基準——證明「小」是一種設計選擇,而非能力上限。它也持續佐證一項主張:AI 的下一波進展,可能來自更好的資料篩選,而不只是擴大規模。
你所需要的只是教科書
該系列奠基論文的標題就是它的論點:你所需要的只是教科書。Phi 團隊並未以未經篩選的網際網路內容訓練模型,而是彙整兩類資料:透過演算法篩出具有「教科書品質」的網頁——內容密集、正確且富有解說性——以及由大型教師模型撰寫、完全屬於Synthetic Data(合成資料)的教材,例如採教科書風格編寫的練習、說明與例題。這項押注立刻奏效:Phi-1 擁有 13 億參數、僅以約 70 億個 token 訓練,卻在 HumanEval 程式設計基準測試上取得足以與數倍規模模型抗衡的成績。之後每一代都沿用這套配方並擴大資料量——Phi-2 約 1.4 兆個 token、Phi-3-mini 為 3.3 兆個、Phi-4 則接近 10 兆個——其中合成資料的占比也逐代提高。
這種方法與蒸餾相近,但並不完全相同:它不是逐 token 複製教師模型的輸出,而是讓教師模型創作新的教材,再篩選這些材料、排除與基準測試集重疊的內容,並與精選的人類文字混合。這種篩選至關重要,因為以未經編輯的模型輸出訓練模型,是導致模型崩塌的已知途徑——錯誤在世代間不斷累積,品質也隨之退化。Phi 的解法是嚴格取捨——Microsoft 表示,候選網頁與生成樣本中只有一小部分會被保留。這套理念翻轉了對Scaling Laws(縮放定律)的常見解讀:只要資料品質夠高,運算最優前緣就會移動,小模型便不再只是資料不足的大模型縮水版。
從 Phi-1 到 Phi-4 的家族
若依世代而非個別模型來梳理,這條產品線會更容易理解。Phi-1 和 Phi-1.5 都出自 2023 年,是擁有 13 億參數的概念驗證模型——前者著重程式碼,後者著重常識推理。Phi-2 於 2023 年底發佈,擁有 27 億參數,首度宣稱能在標準基準測試上與規模數倍於己的模型並駕齊驅。Phi-3 於 2024 年問世,成為真正的模型家族:擁有 38 億參數的 mini(含 4K 與 128K 上下文變體)、70 億參數的 small、140 億參數的 medium,以及一個視覺模型,全都採用 MIT 授權條款。Phi-3.5 更新新增一個具有約 66 億個啟用參數的專家混合模型變體,提高了單位運算量所能換得的品質。
Phi-4 於 2024 年底發表,並在 2025 年初公開釋出;其參數規模提高至 140 億,且比以往更仰賴合成資料,在競賽數學上的表現尤其突出。隨後登場的是擁有 38 億參數的 Phi-4-mini,以及一組經推理調校的變體——它們會在作答前先生成較長的思維鏈,直接把測試時計算套用到小型基礎模型上。實際使用時,命名本身就說明了取捨:mini 適合手機與筆記型電腦,140 億級模型適合單一 GPU 伺服器,而推理變體則適合數學與邏輯準確度比延遲更重要的情境。
小不等於笨
最草率的論斷,是把一個 40 億參數的模型當成玩具。在高度仰賴推理的任務上——小學與競賽數學、程式碼自動完成、邏輯謎題——Phi 系列經常追平甚至擊敗規模為自身兩到五倍的通用模型,因為推理是一種可透過乾淨、密集的教學資料有效傳授的技能。真正的限制在於知識:事實記憶會隨參數數量增加,因此小模型能儲存的冷知識就是比較少。它在冷門事實、日期與引文上更容易產生幻覺,在低資源語言上的能力也較弱。實務上的結論是:當相關事實能在執行階段提供時,Phi 的表現很出色——例如RAG提示、工具使用與文件處理——但若要把它當成一部開卷百科全書,就不是理想選擇。成功部署 Phi 的團隊會把它視為快速推理引擎,而非知識庫。
實際執行 Phi
由於 Phi 採用開放權重,只要有小模型執行的地方,幾乎都能看到它。mini 模型經量化至 4 位元後只占用數 GB,因此可透過 Ollama、llama.cpp 等工具,在筆記型電腦的 CPU、手機或單張消費級 GPU 上順暢執行;Microsoft 也提供針對裝置端與Edge AI(邊緣 AI)情境打造的 ONNX 版本。微調成本同樣很低:mini 模型的 LoRA 轉接器可在單張 GPU 上於數小時內完成訓練,因此 Phi 常被用作專用分類器、擷取器與離線 Copilot 的基礎模型。真正吸引人的是成本效益——為一個 40 億參數模型提供服務,比為前沿 LLM 提供服務便宜一個數量級;對高流量、延遲敏感的任務而言,這項差異足以決定某項功能能否推出。Phi 長期名列 Hugging Face 下載量最高的模型家族,因此相關工具、量化版本與社群微調模型都不難找到。