最重要的數字是一:OpenAI 有史以來第一個無法排除最高網路風險等級的模型。該公司週五在部落格中表示,其下一代模型 Astra 的內部評估顯示,它在智能體編碼和網路安全方面的表現足夠強勁,以至於無法排除其觸及 Preparedness Framework 的 Critical 等級,該框架是公司自 2023 年起執行的安全評級體系。按框架原文,Critical 意味著一個帶工具的模型能在許多加固的關鍵真實系統中,無需人工干預就發現並開發各種嚴重程度的可用零日漏洞利用,或者僅憑粗略定義的目標,針對加固目標設計並執行全新的端到端網路攻擊策略。此前所有 OpenAI 模型,包括 GPT-5.6 Sol,最高都只到 High。

觸發因素是一次能力讀數,而不是一起事故。OpenAI 表示,最近幾天的評估在智能體編碼和網路安全方面返回了'顯著進展',並明確表示 Astra 作為未發布模型,與入侵 Hugging Face 無關。框架對 Critical 的原文要求是在滿足該等級的安全標準被明確之前停止開發,而 OpenAI 的行動恰好停在這條線以內:它暫停了尚未滿足加強護欄的 Astra 內部活動,隔離測試環境,限制網路和工具存取,加固並加密模型權重,並對 Astra 的每一次智能體用途執行通用監控(包括訓練和評估),由思維鏈監控器在高風險活動發生時將其打斷。公司正邀請政府機構和選定的 AI 安全組織測試該模型,第三方測試夥伴也將獲得針對高風險評估的建議控制措施。

Sam Altman 在 X 上確認了實際後果:發布將'為安全推出多花一點時間,但 hopefully 不會太久'。在同一條貼文裡,他揶揄了 Anthropic,後者只向選定夥伴和政府提供其最強模型 Mythos:'我們不認為把有能力的模型只提供給少數強勢方是一個好策略。'OpenAI 研究員 Noam Brown 在自己的貼文中呼籲認真對待 Hugging Face 事件,將其與 2017 年 Facebook 的 AI 被傳發明自己語言的故事相比較,後者被證明是誇大。這一次,他寫道,不是那回事,並把擔憂與 test-time compute 聯繫起來,認為當前模型在到達任何平台期之前還能被推得更遠。

真正要緊的掂量夾在兩句真話之間。第一句:這是潛在可能,不是定級。OpenAI 說的是無法排除 Critical;它並沒有把 Astra 評為 Critical,而如果該等級最終沒有達到,公司等於為一個反正會發布的模型製造了大量關注。The Decoder 預計'恐懼行銷'的指控會隨之而來,而這項指控自帶一個預測:如果這是宣傳,暫停會隨著新聞週期悄悄結束。第二句:框架只有在付出代價時才是真的,而這一週它代價是一扇發布窗口和一次公開承認,當著開著的鏡頭,承認公司的下一代模型可能強到無法按期發布。從這裡開始值得觀察的是:當最終評級存在時 OpenAI 是否會公布它,以及 Anthropic 和 Google 現在是否要面對公開評定自家前沿模型等級的問題,用同一套框架語言,或者不用。