Gemini
为什么重要
深度解析
与其说 Gemini 是一个模型,不如说它是一整条产品线:这是 Google DeepMind 推出的基础模型家族,按代际(1.0、1.5、2.0、2.5)和规模档位(Nano、Flash、Pro、Ultra)发布,在能力、成本和速度之间做取舍。每一代都在 Google 自家的 TPU 硬件上训练,因此 Google 能端到端掌控计算栈,不必完全依赖外部芯片供应商。同一批模型既驱动 Gemini 消费者应用,也通过 AI Studio 和 Vertex AI 中的 Gemini API 提供服务,还被穿插进搜索、Android 和 Workspace 的 AI 功能。Google 还从 Gemini 研究中衍生出更小的开放权重家族 Gemma,供需要自行运行权重的开发者使用。
从 Bard 到 Gemini
Google 通往 Gemini 的路要从 Bard 说起。为了回应 OpenAI 的 ChatGPT,Google 在 2023 年匆忙推出了这款聊天机器人,最初用 LaMDA 驱动,后来换成 PaLM 2。Bard 摇摇晃晃的首秀促使 Google 在 2023 年将旗下两个互相竞争的研究实验室——Google Brain 和 DeepMind——合并为统一的 Google DeepMind,而 Gemini 就是这支联合团队的第一款旗舰产品。1.0 版于 2023 年底登场,分为 Ultra、Pro 和 Nano 三种规模;Bard 悄悄改用 Gemini Pro,短短几个月后,Google 便彻底停用了 Bard 这个名字。此后的迭代节奏很快:1.5 引入混合专家架构和百万 token 上下文窗口,2.0 把重心转向智能体能力与原生工具使用,2.5 则让多步推理成为全系列的标准能力,不再单独作为一种模式。
每种工作都有一个档位
Gemini 的各档位正好对应经典的成本、延迟与能力三角。Nano 是家族里的小语言模型:它能在 Pixel 手机和 Chrome 中直接运行,处理智能回复、摘要等任务,不必绕一趟网络,因此数据留在本地,响应也几乎即时。Flash 位于这组取舍的云端一侧——这是经过蒸馏、针对吞吐量优化的模型,面向大规模工作负载;在这类场景里,每百万 token 的价格比再多挤出几个基准测试分数更重要。Pro 是处理高难度推理、编程和多模态分析的旗舰主力,Ultra 则是 1.0 代的最高档,也是 Google 当时争夺最苛刻任务的筹码。选哪个档位是工程决策,不是忠诚度测试:许多团队先用 Pro 做原型,摸清真实查询分布后,再把简单流量路由给 Flash。
原生多模态
大多数多模态系统都是拼装出来的:拿一个文本模型,接上视觉编码器,再连一个语音转文字前端,最后在推理时把这些部件粘起来。Gemini 从一开始就反着设计——文本、图像、音频和视频以交错形式联合训练,所以各种模态共享同一个表征空间,而不是隔着流水线互递纸条。实际收益最容易在那些会难倒流水线系统的任务上看出来:看完一小时视频后回答某个具体时刻的问题、对一张白板照片进行推理,或是不经过单独转录步骤就跟上口语对话。后续世代还不只会感知,也会生成——聊天内置原生图像输出和编辑,视频则交给 Google 的视频模型 Veo,并直接在 Gemini 应用中开放。这里的多模态是一套训练方法,不是一张功能清单,也是它与 Google 早期 PaLM 等文本优先模型之间最清楚的架构分水岭。
百万 token 上下文窗口
Gemini 1.5 Pro 把长上下文当作头号卖点:在大多数模型上限还只是它零头的时候,就推出了容量达一百万 token 的上下文窗口,后续版本更推进到两百万。具体来说,一百万 token 大致相当于 1500 页文本、一个大型代码库,或数小时的音视频,可以一次塞进同一条提示词——许多工作负载因此不再需要切块和检索。这会改变系统的搭建方式:有时不用专门架一条 RAG 流水线,只要把整套文档扔进提示词就能直接提问。但代价同样重要。输入极长时,注意力质量会下降,因此某个藏在中间的细节即便装得下也可能被漏掉;成本和延迟会随输入长度上升;而语料一旦超过几百万 token,检索终究还是会回来。长上下文确实是一次能力跃迁,但它是在和检索工程做取舍,并没有把后者彻底淘汰。
世上没有一个叫 Gemini 的模型
一个常见的混淆来源是,人们会说“Gemini 告诉我……”仿佛 Gemini 是某一个模型。它从来都不是。这个名字同时指横跨多个世代和档位的模型家族、一个可能根据负载和订阅档位把提示词路由给不同规模模型的消费者应用、一组带明确版本字符串的 API 端点,以及 Workspace 和 Android 里运行其他变体的 AI 功能。同一周里,两个人交流“Gemini”的使用感受,实际对话的模型可能完全不同;你今天在应用里用到的模型,多半也不是几个月前那一个。这对可复现性很重要:包括该家族在 Chatbot Arena 等公开排行榜上的亮眼成绩在内,任何基准结果都只适用于 Gemini 2.5 Pro 之类的具体版本,不适用于整个品牌。需要精确时,就通过 API 锁定确切模型版本——应用的便利层本来就是为了藏起这层区别。