最重要的數字是 50%:Z.ai 宣稱 GLM-5.3 在其內部 Z.ai Code Bench 上相對 GLM-5.2 的提升幅度,而且公司表示完全沒有動基座模型。發布文章開篇寫道:"Scaling post-training is all we did for GLM-5.3",其下的 7430 億參數基座與 GLM-5.2 在 6 月所用的是同一個。模型先進入 Z.ai 的編碼套餐,週四以不變的價格進入公開 API,開放權重承諾在約兩週後、完成額外安全評估後放出。在一個習慣了為新能力付新價錢的市場裡,價格凍結本身就是公告的一部分。

公開數字具體到可以核驗。Z.ai 報告 Terminal-Bench 3.0 得 28.3,DeepSWE 得 66.9,Agents' Last Exam 得 28.5,GDPVal-AA 得 1769,在終端與智能體套件上取得開源領先成績。Nathan Lambert 的 Interconnects 將此次發布解讀為中國實驗室跟上前沿步伐:在多個公開基準上,GLM-5.3 超過 Moonshot 的 Kimi K3,在部分基準上壓過 Claude Fable 5 和 GPT-5.6 Sol,而參數量約為 K3 的三分之一。照例的保留條款仍然適用:內部套件偏向其主人,發布當天的圖表很快過時,但開放權重的承諾把這些說法變成了任何有叢集的人幾週內都能驗證的東西。

分階段發布之下藏著網路安全這條線。Z.ai 稱 GLM-5.3 是其迄今在漏洞發現、漏洞利用分析和複雜多步安全任務上最強的模型,並表示先由選定的安全合作夥伴在受控環境中評估,然後才擴大存取,最後放出完整權重。公司稱在對齊工作之外,還透過請求分類器和思維鏈監控來監視推理。WIRED 把這次發布框定為專家們警告過的那個強大的中國模型:開放權重加上前沿網路能力,正是政策圈兩年來一直在推演的那種組合,而 Z.ai 自己的文本也以明確的語言承認了雙重用途風險。

對開發者而言,戰略信號在配方而非圖表。Z.ai CEO Jie Tang 對 Latent Space 表示,參數競賽正在讓位於後訓練擴展定律;Interconnects 則列舉了這種節奏背後的結構性優勢:以天而非以月計的發布週期、據報導接近 10 億美元年收入的本地部署業務,以及清華的人才管道。務實的應對與每次開放權重發布時一樣:等 checkpoint 放出,在自己的任務上跑,並把任何人的基準頁面(包括本文引用的那些)當作待證偽的假設。