Gemma
为什么重要
深度解析
Gemma 于 2024 年登场,是 Google 加入开放权重模型竞赛的作品,而这场竞赛一年前由 Meta 的 Llama 点燃。它由 Google DeepMind 打造,沿用了创建 Gemini 模型时的同一套研究和技术,至今已经历三代:初代 Gemma(20 亿和 70 亿参数)、Gemma 2(90 亿和 270 亿),以及 Gemma 3(10 亿、40 亿、120 亿和 270 亿);第三代又加入图像理解、128k token 上下文窗口,并支持 140 多种语言。所有 Gemma 都是仅解码器 Transformer,在 Google 的 TPU 上训练,并以可下载权重形式按自定义许可证发布,允许商业使用。它的主张很简单:把前沿实验室训练流水线的质量,压缩进一个你真能自己跑起来的模型。
该选多大
名字里的数字就是参数量,每个档位瞄准的机器也不同。1B 模型可以轻松跑在手机甚至浏览器里,4B 很适合笔记本电脑和小型边缘设备,12B 是在单张消费级 GPU 上做微调的热门底座,旗舰 27B 则需要工作站 GPU 或小型服务器,但模型质量已经逼近参数规模大出许多倍的专有模型。同一代的各个尺寸共享相同架构、分词器和训练配方,因此日后沿尺寸阶梯上调或下调只是改一项配置,不是推倒重来。真正要权衡的是每次请求的质量与硬件预算——端侧使用还得算上电量和内存。
小到哪里都能跑
Gemma 的大部分使用场景都在数据中心之外。把 4B 模型量化到 4 bit 后,体积会缩到几 GB,现代笔记本或旗舰手机都能以可读的速度运行;繁重的适配工作则交给社区工具:llama.cpp 和 Ollama 为每种 Gemma 尺寸都提供开箱即用的 GGUF 构建。这就是小语言模型理念落到实处的样子——模型由你掌控,可以离线工作,把用户数据留在设备上,而且每次请求的边际成本为零。对隐私敏感型应用、离线工具和嵌入式助手来说,这组特性往往比基准测试最后几个百分点更重要。Google 还用自家的移动端和浏览器运行时支持继续加码,而且与其他开放权重家族相比,这套支持打磨得格外成熟。
微调才是主战场
因为权重可以下载,Gemma 已经成为生态中微调版本最多的模型家族之一。LoRA 等参数高效方法,让实践者可以在单张 GPU 上用几个小时,把 4B 或 12B Gemma 改造成专门干某项小众工作的模型——客服机器人的口吻、法律摘要器、专业分类器都可以;Hugging Face 上还有数千个社区微调版本可供起步。Google 自己也发布衍生模型:面向代码的 CodeGemma、面向视觉语言任务的 PaliGemma,以及用于安全分类的 ShieldGemma。基础模型的一部分实力还来自蒸馏,也就是让更大的教师模型用输出帮助训练小模型——这也是 Gemma 的表现总能超过参数量预期的原因之一。
开放权重不等于开源
一个常见误区是把 Gemma 当成开源模型。它是开放权重,这是另一回事:Google 按自定义的《Gemma 使用条款》发布文件,允许商业使用、修改和再分发,但也附有禁止用途政策,并保留限制违规使用的权利。日常实践中,这几乎不会拦住谁——许多初创公司不用申请许可就已经在 Gemma 上发布商业产品——但它并不具备 Apache 2.0 那样的自由度;Qwen 的大多数模型采用的正是后者,如果你的法务团队在意许可证的纯粹性,这个区别就很关键。同样的细微差别也适用于 Meta 的 Llama 许可证:开放权重说的是你能下载什么,不是下载物附带什么条款。听到别人说“开放模型”时,值得追问一句,他指的究竟是哪一种。
Gemma 的位置
Gemma 所在的赛道挤满了对手,包括较小的 Llama 模型、Qwen 和 Microsoft Phi;老实说,每次发布新版本,这几个家族都会交替反超。Gemma 最鲜明的优势是训练出身——很少有小模型能走完前沿实验室的整套流水线——以及第一方端侧部署支持。它的局限则恰好是体量优势的另一面:家族里没有任何模型能在最难的推理问题上挑战前沿模型,而且和所有小模型一样,它记住的世界知识更少,也比大号亲戚更容易产生幻觉。团队通常会在需要一款能力不错、运行便宜、端到端归自己掌控的基础模型时选择 Gemma;如果任务需要前沿系统的全部实力,还是会转向托管 API 模型。