美国初创公司Poolside发布了Laguna S 2.1,这是一款为智能体编程打造的开放权重模型,而它的故事在于其体量。它是一款混合专家模型,总参数达1180亿,但对任何给定token仅有约80亿活跃参数,这使得它运行成本低廉,并在对代码至关重要的基准测试中击败了体量数倍于它的系统。
数字就是论据。Laguna S 2.1在SWE-Bench Multilingual上取得78.5%的成绩,直接登顶已公布的排行榜,并在开启推理模式后于Terminal-Bench 2.1上取得70.2%。在一项名为DeepSWE的长跨度编程基准测试中,它取得40.4%,而顶尖的DeepSeek模型仅为9.0%,同时它所承载的活跃参数约为后者的六分之一。它足以与体量数倍于它的模型抗衡,包括来自DeepSeek、NVIDIA和Thinking Machines的系统。
经济性源于其架构。由于每个token仅有80亿参数被激活,该模型的服务成本很低,Poolside在较短上下文长度下于OpenRouter上免费提供,而在完整的百万token长度下,其成本最多可比前沿模型低50倍。对于那些智能体需要处理长时间编程任务的团队而言,每token价格和上下文长度就是全部决策依据,而一款成绩堪比大模型的小型开放模型改变了这一算式。
这一定位刻意带有地缘政治色彩。在过去一年的大部分时间里,小型、廉价、强大的开放权重模型一直是中国的强项,DeepSeek、Qwen和Kimi引领着节奏,而西方实验室大多推出的是大型封闭系统。Laguna S 2.1被宣传为西方的回应,是一场押注,赌的是行为与训练比单纯的规模更重要,赌的是一家美国实验室能够在中国实验室所占据的同一片高效开放阵地上取胜。
需要注意的一点,对于一家年轻实验室的基准测试成绩表而言是老生常谈。该排行榜由Poolside自行汇编,而独立评测与现实世界的采用情况才能证实Laguna S 2.1在实践中是否与在图表上表现得一样好。但方向是明确的,而且这很重要,因为当下模型竞赛中最有趣的前沿并不是最大的系统,而是仍能胜任工作的最小系统。
