Gemma
為什麼重要
深度解析
Gemma 於 2024 年登場,是 Google 加入開放權重模型競賽的作品;這場競賽在一年前由 Meta 的 Llama 點燃。它由 Google DeepMind 打造,沿用建立 Gemini 模型時的同一套研究與技術,至今已經歷三代:初代 Gemma(20 億與 70 億參數)、Gemma 2(90 億與 270 億),以及 Gemma 3(10 億、40 億、120 億與 270 億);第三代又加入圖像理解、128k token 上下文視窗,並支援 140 多種語言。所有 Gemma 都是僅含 Decoder 的 Transformer,在 Google TPU 上訓練,並依自訂授權以可下載權重的形式發佈,允許商業使用。它的主張很簡單:把前沿實驗室訓練管線的品質,壓縮進一個你真的能自行執行的模型。
該選多大
名稱裡的數字就是參數量,每個尺寸瞄準的機器也不同。1B 模型可以輕鬆跑在手機甚至瀏覽器裡,4B 很適合筆記型電腦與小型邊緣裝置,12B 是在單張消費級 GPU 上微調的熱門基礎,旗艦 27B 則需要工作站 GPU 或小型伺服器,但模型品質已逼近參數規模大上許多倍的專有模型。同一代的各種尺寸共享相同架構、Tokenizer 與訓練配方,因此日後沿著尺寸階梯上調或下調,只是改一項設定,不必推倒重來。真正要權衡的是每次請求的品質與硬體預算——若在裝置端使用,還得考量電量與記憶體。
小到哪裡都能跑
Gemma 的大多數使用情境都在資料中心之外。把 4B 模型量化到 4 bit 後,體積會縮到幾 GB,現代筆記型電腦或旗艦手機都能以足以順暢閱讀的速度執行;繁重的整合工作則交給社群工具:llama.cpp 與 Ollama 為每種 Gemma 尺寸都提供開箱即用的 GGUF 版本。這就是小型語言模型理念落到實處的模樣——模型由你掌控,可以離線工作,把使用者資料留在裝置上,而且每次請求的邊際成本為零。對重視隱私的應用程式、離線工具與嵌入式助手來說,這組特性往往比基準測試最後幾個百分點更重要。Google 還以自家的行動裝置與瀏覽器執行環境持續加碼;與其他開放權重家族相比,這套支援打磨得格外成熟。
微調才是主戰場
由於權重可以下載,Gemma 已成為生態系中微調版本最多的模型家族之一。LoRA 等參數高效方法,讓實務工作者只用單張 GPU 與幾個小時,就能把 4B 或 12B Gemma 改造成專門處理特定工作的模型——客服機器人的口吻、法律摘要器、專業分類器都可以;Hugging Face 上還有數千個社群微調版本可供起步。Google 自己也發佈衍生模型:針對程式碼打造的 CodeGemma、處理視覺語言任務的 PaliGemma,以及用於安全分類的 ShieldGemma。基礎模型的部分實力還來自 Distillation(蒸餾),也就是讓較大的教師模型以輸出協助訓練小模型——這也是 Gemma 表現總能超越參數量預期的原因之一。
開放權重不等於開放原始碼
一個常見誤解,是把 Gemma 當成開放原始碼模型。它是開放權重,這是另一回事:Google 依自訂的《Gemma Terms of Use》發佈檔案,允許商業使用、修改與再散佈,但也附有禁止用途政策,並保留限制違規使用的權利。日常實務中,這幾乎不會攔住誰——許多新創公司不必申請授權,就已經在 Gemma 上發佈商業產品——但它並沒有 Apache 2.0 那樣的自由度;Qwen 的多數模型採用後者,如果你的法務團隊在意授權純度,這個差異就很重要。同樣的細微差別也適用於 Meta 的 Llama 授權:開放權重描述的是你能下載什麼,不是下載內容附帶哪些條款。聽到別人說「開放模型」時,值得追問一句:他指的究竟是哪一種。
Gemma 的位置
Gemma 所在的賽道擠滿了對手,包括較小的 Llama 模型、Qwen 與 Microsoft Phi;老實說,每次推出新版本,這幾個家族都會交替超車。Gemma 最鮮明的優勢是訓練出身——很少有小模型能走完前沿實驗室的整套管線——以及第一方裝置端部署支援。它的限制則恰好是規模優勢的另一面:家族裡沒有任何模型能在最困難的推理問題上挑戰前沿模型;而且和所有小模型一樣,它掌握的世界知識較少,也比大型親戚更容易產生幻覺。團隊通常會在需要一款能力不錯、執行成本低、能端到端自行掌控的基礎模型時選擇 Gemma;如果任務需要前沿系統的完整實力,還是會轉向託管 API 模型。