美國新創公司Poolside發布了Laguna S 2.1,這是一款專為代理式程式設計打造的開放權重模型,而它的關鍵在於其規模。它是一款混合專家模型,總參數達1180億,但對任一給定token僅有約80億活躍參數,這使得它的執行成本低廉,並在攸關程式碼的基準測試中,擊敗了規模數倍於自身的系統。

數字就是論據。Laguna S 2.1在SWE-Bench Multilingual上取得78.5%的成績,直接登上已公布排行榜的榜首,並在開啟推理模式後於Terminal-Bench 2.1上取得70.2%。在一項名為DeepSWE的長時程程式設計基準測試中,它取得40.4%,而頂尖的DeepSeek模型僅為9.0%,同時它所搭載的活躍參數約為後者的六分之一。它足以與規模數倍於自身的模型抗衡,包括來自DeepSeek、NVIDIA與Thinking Machines的系統。

經濟性源自其架構。由於每個token僅有80億參數被啟動,該模型的服務成本很低,Poolside在較短脈絡長度下於OpenRouter上免費提供,而在完整的百萬token長度下,其成本最多可比前沿模型低50倍。對於那些旗下代理需要處理漫長程式設計任務的團隊而言,每token價格與脈絡長度就是全部的決策依據,而一款成績媲美大型模型的小型開放模型,改變了這道算式。

這一定位刻意帶有地緣政治色彩。在過去一年的大部分時間裡,小型、廉價、強大的開放權重模型一直是中國的強項,由DeepSeek、Qwen與Kimi引領步調,而西方實驗室大多推出的是大型封閉系統。Laguna S 2.1被定位為西方的回應,是一場押注,賭的是行為與訓練比單純的規模更重要,也賭一家美國實驗室能夠在中國實驗室所佔據的同一片高效開放領域上取勝。

需要注意的一點,對於一家年輕實驗室的基準測試成績表而言是老生常談。該排行榜由Poolside自行彙整,而獨立評測與真實世界的採用情況,才能證實Laguna S 2.1在實務中是否與在圖表上表現得一樣出色。但方向是明確的,而且這很重要,因為當下模型競賽中最耐人尋味的戰線並非最大的系統,而是仍能勝任工作的最小系統。