跳到主要内容
Zubnet AI学习Wiki › Llama
模型

Llama

别名:LLaMA、Meta Llama
Meta 推出的大型语言模型系列,其权重可在自定义社区许可下自由下载。历经四个主要世代,参数规模从 1B 到 405B 不等,Llama 模型已成为微调、本地推理和开放研究的默认起点。该名称最初是 Large Language Model Meta AI 的缩写。

为什么重要

由于任何人都可以下载其权重,Llama 是开放模型生态的锚点:本地推理工具、数以千计的微调模型,以及相当大比例的商业 AI 产品都可以追溯到它。它也是其他所有开放权重模型进行对比评测的基线,因此了解 Llama 的产品线,就能知道开放阵营的前沿处于什么位置。

深度解析

Llama 不是单个模型,而是 Meta AI 发布的一系列模型组成的谱系。理解这个家族需要同时跟进两条线索:从 Llama 1 到 Llama 4 的技术线,以及把一项研究成果变成行业共享基础设施的许可线。每次发布都以可下载权重加分词器和参考代码的形式提供,因此任何拥有足够 GPU 显存的人——或者对于较小尺寸,一台普通笔记本电脑——都可以在本地运行模型、微调它、量化它,或将其嵌入产品中。正是这种可靠质量与完全本地控制的结合,使 Llama 成为开放权重生态的参照点:当 Mistral、Qwen 或 DeepSeek 发布新模型时,从业者问的第一个问题就是它与同尺寸的 Llama 相比如何。

从研究泄露到产品家族

最初的 LLaMA 于 2023 年 2 月发布,纯属研究性质:参数规模从 7B 到 65B,需要申请才能获取,且许可仅限非商业用途。完整权重在几天内就被泄露,意外证明了人们对能自行运行的强能力模型有着巨大的需求。Meta 顺应了这种需求,于 2023 年 7 月推出 Llama 2,提供 7B、13B 和 70B 三种尺寸,许可证允许大多数商业用途,并附带用 RLHF 调校的聊天变体。2024 年的 Llama 3 世代再次提高门槛,训练语料约 15 万亿 token:先是 8B 和 70B 尺寸,随后 Llama 3.1 推出 405B 旗舰,3.2 推出 1B 和 3B 小型文本模型以及具备视觉能力的 11B 和 90B 版本,3.3 则推出了注重效率的 70B。Llama 4 于 2025 年到来,采用专家混合模型架构:已发布的模型为 Scout 和 Maverick,而规模大得多的 Behemoth 被描述为仍在训练中的教师模型。

成为默认选择的架构

在架构上,Llama 是仅解码器的 Transformer,每一代都是渐进式演进而非激进变革:用 RMSNorm 做预归一化、旋转位置编码、SwiGLU 前馈层,并从 Llama 2 的 70B 开始采用GQA(分组查询注意力)以在推理时缩小 KV 缓存。这些选择没有一项是 Meta 发明的,但 Llama 的流行使其成为事实上的标准配方,人们现在随口就会把遵循同一模板的其他模型称为“Llama 架构”。这种标准化有实际价值:vLLM、SGLang 和 llama.cpp 等推理栈都优先、最深地针对 Llama 形态的模型优化,一些实验室刻意让自己的发布与 Llama 兼容,以便工具链开箱即用。Llama 3 的 128k token 词汇表和 3.1 引入的 128k token 上下文窗口,同样成为衡量其他开放模型的参照点。

开放权重不等于开源

一个长期存在的误解是认为 Llama 是开源的。至少按照 Open Source Initiative(开放源代码促进会)的定义,它不是:Meta 的 Llama 社区许可证授予了使用、修改和再分发模型的广泛权利,但带有 OSI 标准所不允许的使用领域限制。月活跃用户超过 7 亿的公司需要获得 Meta 的单独许可;《可接受使用政策》限制某些应用场景;衍生模型必须在名称中包含 Llama,并展示“Built with Llama”署名。某些版本还有地域性的特殊条款——例如多模态的 Llama 3.2 模型就不授权给注册地在欧盟的公司。对个人开发者或小型初创公司来说,这些通常在实践中无关紧要,但这正是法务团队关心的那类细则,也是开放与封闭光谱最鲜明的例证:可下载的权重并不等同于 Apache 2.0 或 MIT 许可证。

围绕权重形成的生态

权重本身只是故事的一半;围绕它们构建的工具和衍生模型可以说才是 Llama 最大的贡献。Llama 1 泄露后几周内,Alpaca 和 Vicuna 等项目证明,用合成数据做一次低成本的指令微调就能把基础模型变成可用的聊天机器人,开启了现代微调浪潮。Georgi Gerganov 的 llama.cpp 使量化后的 Llama 模型能够在消费级 CPU 和笔记本上运行,催生了 GGUF 格式和一整套本地推理栈(包括 Ollama),而 Hugging Face 如今托管着数以万计的 Llama 微调、合并和量化版本。得益于蒸馏和模型合并,许多号称全新的开放模型在底层其实是 Llama 的衍生品。这种网络效应会自我强化:因为人人都优先为 Llama 做适配,选择 Llama 就意味着最好的工具支持,这反过来又让它保持默认地位,即使竞争对手跑出了略好的基准分数。

← 所有术语
ESC