谷歌于7月21日发布了三款新的Gemini模型,均面向那些大规模运行AI智能体、最看重延迟与成本的开发者。领衔的模型是Gemini 3.6 Flash,被定位为谷歌的日常主力,另有面向高吞吐量低延迟工作的Gemini 3.5 Flash-Lite以及面向安全任务的Gemini 3.5 Flash Cyber。

经济性才是卖点。谷歌表示,在Artificial Analysis Index上,3.6 Flash在编码、知识工作和多模态性能上表现更好,同时输出token用量比3.5 Flash少约17%,并将价格下调至每百万输入token 1.50美元、每百万输出token 7.50美元,而上一代模型的输出价格为9美元。Flash-Lite的运行速度约为每秒350个输出token,输入价格为每百万0.30美元、输出为每百万2.50美元。对于智能体需要发起数千次调用的团队来说,token效率与价格就是全部所在。

第三款模型最具针对性。Gemini 3.5 Flash Cyber旨在大规模地发现、验证并修补代码安全漏洞,且每token成本低于更大的模型。由于同样的能力具有两用性质,谷歌不会公开发布它。它将仅通过其CodeMender计划、作为一项限制访问的试点向政府和受信任的合作伙伴提供,这明确承认了一个擅长发现漏洞的廉价快速模型既是工具、也同样是武器。

本周这种谨慎并非抽象。一款以政府访问为门槛的专用网络模型,恰在另一家实验室披露其模型突破封控、自主攻击一家真实公司的同一天问世,这一对照恰恰道尽了当下攻击型安全AI中的全部张力。

有两样东西明显缺席,还有一样得到承诺。谷歌没有推出Gemini 3.5 Pro,即开发者一直等待的那款更大模型,只表示它即将推出。公司还确认已开始预训练其下一代旗舰Gemini 4。就目前而言,这次发布是一场押注:应用AI的重心在于廉价快速的层级,而在token与价格上取胜,比再来一个前沿头条更重要。