跳到主要内容
Zubnet AI学习Wiki › Gemma
模型

Gemma

别名:Google Gemma、Gemma 3
Google 推出的开放权重语言模型家族,由 Google DeepMind 使用 Gemini 背后的同一套研究与技术打造。Gemma 从设计之初就走小模型路线——参数规模从 10 亿到 270 亿不等——并以可下载权重的形式发布,因此任何人都能在自己的硬件上运行、微调和部署,不必调用托管 API。

为什么重要

Gemma 把前沿实验室级别的训练质量装进了笔记本电脑、手机或单张 GPU 就能承载的模型,因此自然成了微调、原型开发和端侧 AI 的默认起点。权重免费,许可证又允许商业使用,团队可以基于 Gemma 发布产品,不用支付按 token 计费的 API 账单,也不用把用户数据交给第三方。

深度解析

Gemma 于 2024 年登场,是 Google 加入开放权重模型竞赛的作品,而这场竞赛一年前由 Meta 的 Llama 点燃。它由 Google DeepMind 打造,沿用了创建 Gemini 模型时的同一套研究和技术,至今已经历三代:初代 Gemma(20 亿和 70 亿参数)、Gemma 2(90 亿和 270 亿),以及 Gemma 3(10 亿、40 亿、120 亿和 270 亿);第三代又加入图像理解、128k token 上下文窗口,并支持 140 多种语言。所有 Gemma 都是仅解码器 Transformer,在 Google 的 TPU 上训练,并以可下载权重形式按自定义许可证发布,允许商业使用。它的主张很简单:把前沿实验室训练流水线的质量,压缩进一个你真能自己跑起来的模型。

该选多大

名字里的数字就是参数量,每个档位瞄准的机器也不同。1B 模型可以轻松跑在手机甚至浏览器里,4B 很适合笔记本电脑和小型边缘设备,12B 是在单张消费级 GPU 上做微调的热门底座,旗舰 27B 则需要工作站 GPU 或小型服务器,但模型质量已经逼近参数规模大出许多倍的专有模型。同一代的各个尺寸共享相同架构、分词器和训练配方,因此日后沿尺寸阶梯上调或下调只是改一项配置,不是推倒重来。真正要权衡的是每次请求的质量与硬件预算——端侧使用还得算上电量和内存。

小到哪里都能跑

Gemma 的大部分使用场景都在数据中心之外。把 4B 模型量化到 4 bit 后,体积会缩到几 GB,现代笔记本或旗舰手机都能以可读的速度运行;繁重的适配工作则交给社区工具:llama.cppOllama 为每种 Gemma 尺寸都提供开箱即用的 GGUF 构建。这就是小语言模型理念落到实处的样子——模型由你掌控,可以离线工作,把用户数据留在设备上,而且每次请求的边际成本为零。对隐私敏感型应用、离线工具和嵌入式助手来说,这组特性往往比基准测试最后几个百分点更重要。Google 还用自家的移动端和浏览器运行时支持继续加码,而且与其他开放权重家族相比,这套支持打磨得格外成熟。

微调才是主战场

因为权重可以下载,Gemma 已经成为生态中微调版本最多的模型家族之一。LoRA 等参数高效方法,让实践者可以在单张 GPU 上用几个小时,把 4B 或 12B Gemma 改造成专门干某项小众工作的模型——客服机器人的口吻、法律摘要器、专业分类器都可以;Hugging Face 上还有数千个社区微调版本可供起步。Google 自己也发布衍生模型:面向代码的 CodeGemma、面向视觉语言任务的 PaliGemma,以及用于安全分类的 ShieldGemma。基础模型的一部分实力还来自蒸馏,也就是让更大的教师模型用输出帮助训练小模型——这也是 Gemma 的表现总能超过参数量预期的原因之一。

开放权重不等于开源

一个常见误区是把 Gemma 当成开源模型。它是开放权重,这是另一回事:Google 按自定义的《Gemma 使用条款》发布文件,允许商业使用、修改和再分发,但也附有禁止用途政策,并保留限制违规使用的权利。日常实践中,这几乎不会拦住谁——许多初创公司不用申请许可就已经在 Gemma 上发布商业产品——但它并不具备 Apache 2.0 那样的自由度;Qwen 的大多数模型采用的正是后者,如果你的法务团队在意许可证的纯粹性,这个区别就很关键。同样的细微差别也适用于 Meta 的 Llama 许可证:开放权重说的是你能下载什么,不是下载物附带什么条款。听到别人说“开放模型”时,值得追问一句,他指的究竟是哪一种。

Gemma 的位置

Gemma 所在的赛道挤满了对手,包括较小的 Llama 模型、Qwen 和 Microsoft Phi;老实说,每次发布新版本,这几个家族都会交替反超。Gemma 最鲜明的优势是训练出身——很少有小模型能走完前沿实验室的整套流水线——以及第一方端侧部署支持。它的局限则恰好是体量优势的另一面:家族里没有任何模型能在最难的推理问题上挑战前沿模型,而且和所有小模型一样,它记住的世界知识更少,也比大号亲戚更容易产生幻觉。团队通常会在需要一款能力不错、运行便宜、端到端归自己掌控的基础模型时选择 Gemma;如果任务需要前沿系统的全部实力,还是会转向托管 API 模型。

← 所有术语
ESC