跳到主要內容
Zubnet AI學習Wiki › Llama
模型

Llama

別名:LLaMA、Meta Llama
Meta 推出的大型語言模型家族,其權重可依自訂社群授權自由下載。歷經四個主要世代,參數規模從 1B 到 405B 不等,Llama 模型已成為微調、本地推論與開放研究的預設起點。這個名稱原本是 Large Language Model Meta AI 的縮寫。

為什麼重要

由於任何人都能下載權重,Llama 是開放模型生態系的錨點:本地推論工具、數以千計的微調模型,以及相當大比例的商業 AI 產品,都能追溯到它。它也是其他開放權重模型進行基準比較時的基線,因此只要了解 Llama 的產品陣容,便能知道開放陣營的前沿走到哪裡。

深度解析

Llama 不是單一模型,而是 Meta AI 一脈相承的一系列版本。理解這個家族,需要同時追蹤兩條線:從 Llama 1 到 Llama 4 的技術路線,以及把研究成果變成業界共享基礎設施的授權路線。每個版本都提供可下載的權重、Tokenizer 與參考程式碼,因此只要有足夠的 GPU 記憶體——較小尺寸甚至只需一台普通筆記型電腦——任何人都能在本地執行模型、微調、量化,或把它嵌入產品。可靠品質與完全本地控制的組合,正是 Llama 成為開放權重生態系參照點的原因:每當 Mistral、Qwen 或 DeepSeek 發佈新模型,實務工作者第一個問題就是,它與同尺寸的 Llama 相比如何。

從研究洩露到產品家族

最初的 LLaMA 於 2023 年 2 月發佈,純粹用於研究:尺寸從 7B 到 65B,必須提出申請才能取得,而且授權僅限非商業用途。完整權重幾天內便外洩,意外證明人們多麼需要一款能自行執行的強大模型。Meta 順勢回應這股需求,在 2023 年 7 月推出 Llama 2,提供 7B、13B、70B 三種尺寸;授權允許大多數商業用途,另附上以 RLHF 調校的聊天變體。2024 年的 Llama 3 世代再次拉高標準,使用約 15 兆 token 的語料訓練:先推出 8B 和 70B,接著 Llama 3.1 帶來 405B 旗艦,3.2 加入 1B、3B 小型文字模型,以及具備視覺能力的 11B、90B 版本,3.3 則推出講求效率的 70B。Llama 4 於 2025 年登場,採用專家混合模型架構:已釋出的模型是 Scout 和 Maverick,規模大得多的 Behemoth 則被描述為仍在訓練的教師模型。

成為預設選擇的架構

從架構來看,Llama 是只使用 Decoder 的 Transformer;每一代都是逐步演進,而非激進變革:以 RMSNorm 做預先正規化、使用旋轉位置編碼與 SwiGLU 前饋層,並從 Llama 2 70B 起採用GQA(分組查詢注意力),在推論時縮小 KV 快取。這些選擇沒有一項是 Meta 發明的,但 Llama 的普及讓它們成為事實上的標準配方;如今,只要其他模型遵循相同範本,人們便會隨口稱之為「Llama 架構」。這種標準化很有實際價值:vLLM、SGLang 和 llama.cpp 等推論堆疊,都會最早、也最深入地針對 Llama 型模型進行最佳化;有些實驗室還刻意讓自家版本與 Llama 相容,好讓工具鏈開箱即用。Llama 3 的 128k token 詞彙表,以及 3.1 引入的 128k token 上下文視窗,同樣成了衡量其他開放模型的參照點。

開放權重不等於開放原始碼

一個揮之不去的誤解,是把 Llama 當成開放原始碼。至少按照 Open Source Initiative(開放原始碼促進會)的定義,它並不是:Meta 的 Llama Community License 廣泛允許使用、修改與再散佈模型,但也帶有 OSI 標準不接受的用途限制。每月活躍使用者超過 7 億的公司,必須另外取得 Meta 授權;《Acceptable Use Policy》限制某些應用情境;衍生模型的名稱必須包含 Llama,並標示「Built with Llama」。部分版本還有區域性的特殊條款——例如多模態 Llama 3.2 就不授權給註冊地在歐盟的公司。對個人開發者或小型新創公司來說,這些條款通常不影響實際使用,但它們正是法務團隊在意的細則,也是開放 vs. 封閉光譜最鮮明的例子:可以下載權重,不等於採用 Apache 2.0 或 MIT 授權。

圍繞權重形成的生態系

權重本身只是故事的一半;圍繞它們打造的工具與衍生模型,或許才是 Llama 最大的貢獻。Llama 1 外洩後幾週內,Alpaca、Vicuna 等專案證明,只要用合成資料進行一次低成本指令微調,就能把基礎模型變成可用的聊天機器人,開啟現代微調浪潮。Georgi Gerganov 的 llama.cpp 讓量化後的 Llama 模型可以在消費級 CPU 與筆記型電腦上執行,催生 GGUF 格式,以及包含 Ollama 在內的整套本地推論堆疊;Hugging Face 如今則代管數以萬計的 Llama 微調、合併與量化版本。拜蒸餾與模型合併所賜,許多號稱全新的開放模型,底層其實都是 Llama 的衍生品。這種網路效應會自我強化:人人都優先支援 Llama,因此選擇 Llama 就意味著最好的工具支援;反過來,即使競爭對手跑出稍好的基準分數,它仍能穩坐預設位置。

← 所有術語
ESC