最重要的数字是一:OpenAI 有史以来第一个无法排除最高网络风险等级的模型。该公司周五在博客中表示,其下一代模型 Astra 的内部评估显示,它在智能体编码和网络安全方面的表现足够强劲,以至于无法排除其触及 Preparedness Framework 的 Critical 等级,该框架是公司自 2023 年起运行的安全评级体系。按框架原文,Critical 意味着一个带工具的模型能在许多加固的关键真实系统中,无需人工干预就发现并开发各种严重程度的可用零日漏洞利用,或者仅凭粗略定义的目标,针对加固目标设计并执行全新的端到端网络攻击策略。此前所有 OpenAI 模型,包括 GPT-5.6 Sol,最高都只到 High。

触发因素是一次能力读数,而不是一起事故。OpenAI 表示,最近几天的评估在智能体编码和网络安全方面返回了'显著进展',并明确表示 Astra 作为未发布模型,与入侵 Hugging Face 无关。框架对 Critical 的原文要求是在满足该等级的安全标准被明确之前停止开发,而 OpenAI 的行动恰好停在这条线以内:它暂停了尚未满足加强护栏的 Astra 内部活动,隔离测试环境,限制网络和工具访问,加固并加密模型权重,并对 Astra 的每一次智能体用途运行通用监控(包括训练和评估),由思维链监控器在高风险活动发生时将其打断。公司正邀请政府机构和选定的 AI 安全组织测试该模型,第三方测试伙伴也将获得针对高风险评估的建议控制措施。

Sam Altman 在 X 上确认了实际后果:发布将'为安全推出多花一点时间,但 hopefully 不会太久'。在同一条帖子里,他揶揄了 Anthropic,后者只向选定伙伴和政府提供其最强模型 Mythos:'我们不认为把有能力的模型只提供给少数强势方是一个好策略。'OpenAI 研究员 Noam Brown 在自己的帖子中呼吁认真对待 Hugging Face 事件,将其与 2017 年 Facebook 的 AI 被传发明自己语言的故事相比较,后者被证明是夸大。这一次,他写道,不是那回事,并把担忧与 test-time compute 联系起来,认为当前模型在到达任何平台期之前还能被推得更远。

真正要紧的掂量夹在两句真话之间。第一句:这是潜在可能,不是定级。OpenAI 说的是无法排除 Critical;它并没有把 Astra 评为 Critical,而如果该等级最终没有达到,公司等于为一个反正会发布的模型制造了大量关注。The Decoder 预计'恐惧营销'的指控会随之而来,而这项指控自带一个预测:如果这是宣传,暂停会随着新闻周期悄悄结束。第二句:框架只有在付出代价时才是真的,而这一周它代价是一扇发布窗口和一次公开承认,当着开着的镜头,承认公司的下一代模型可能强到无法按期发布。从这里开始值得观察的是:当最终评级存在时 OpenAI 是否会公布它,以及 Anthropic 和 Google 现在是否要面对公开评定自家前沿模型等级的问题,用同一套框架语言,或者不用。