最重要的数字是 50%:Z.ai 宣称 GLM-5.3 在其内部 Z.ai Code Bench 上相对 GLM-5.2 的提升幅度,而且公司表示完全没有动基座模型。发布文章开篇写道:"Scaling post-training is all we did for GLM-5.3",其下的 7430 亿参数基座与 GLM-5.2 在 6 月所用的是同一个。模型先进入 Z.ai 的编码套餐,周四以不变的价格进入公开 API,开放权重承诺在约两周后、完成额外安全评估后放出。在一个习惯了为新能力付新价钱的市场里,价格冻结本身就是公告的一部分。
公开数字具体到可以核验。Z.ai 报告 Terminal-Bench 3.0 得 28.3,DeepSWE 得 66.9,Agents' Last Exam 得 28.5,GDPVal-AA 得 1769,在终端与智能体套件上取得开源领先成绩。Nathan Lambert 的 Interconnects 将此次发布解读为中国实验室跟上前沿步伐:在多个公开基准上,GLM-5.3 超过 Moonshot 的 Kimi K3,在部分基准上压过 Claude Fable 5 和 GPT-5.6 Sol,而参数量约为 K3 的三分之一。照例的保留条款仍然适用:内部套件偏向其主人,发布当天的图表很快过时,但开放权重的承诺把这些说法变成了任何有集群的人几周内都能验证的东西。
分阶段发布之下藏着网络安全这条线。Z.ai 称 GLM-5.3 是其迄今在漏洞发现、漏洞利用分析和复杂多步安全任务上最强的模型,并表示先由选定的安全合作伙伴在受控环境中评估,然后才扩大访问,最后放出完整权重。公司称在对齐工作之外,还通过请求分类器和思维链监控来监视推理。WIRED 把这次发布框定为专家们警告过的那个强大的中国模型:开放权重加上前沿网络能力,正是政策圈两年来一直在推演的那种组合,而 Z.ai 自己的文本也以明确的语言承认了双重用途风险。
对开发者而言,战略信号在配方而非图表。Z.ai CEO Jie Tang 对 Latent Space 表示,参数竞赛正在让位于后训练扩展定律;Interconnects 则列举了这种节奏背后的结构性优势:以天而非以月计的发布周期、据报道接近 10 亿美元年收入的本地部署业务,以及清华的人才管道。务实的应对与每次开放权重发布时一样:等 checkpoint 放出,在自己的任务上跑,并把任何人的基准页面(包括本文引用的那些)当作待证伪的假设。
