जो संख्या मायने रखती है वह है एक: पहला model जिसे OpenAI कभी अपने सबसे ऊँचे cyber-risk tier से हटा नहीं पाई। शुक्रवार को एक blog post में, company ने कहा कि Astra, उसके आगामी model, के internal evaluations में agentic coding और cybersecurity में इतना मज़बूत performance दिखा कि वह अपने Preparedness Framework के Critical level को rule out नहीं कर सकती, वह safety-rating system जो वह 2023 से चलाती है। Framework के अपने text के मुताबिक़, Critical का मतलब है एक tool-enabled model जो बिना human intervention के कई hardened, critical real-world systems में किसी भी severity के working zero-day exploits खोज और विकसित कर सके, या केवल एक roughly defined goal से hardened targets के ख़िलाफ़ novel end-to-end cyberattack strategies की रचना और execution कर सके। इससे पहले के हर OpenAI model, GPT-5.6 Sol समेत, High से ऊपर नहीं गया।
Trigger एक capability reading है, कोई incident नहीं। OpenAI कहती है कि पिछले दिनों की evaluations ने agentic coding और cybersecurity में 'significant advancements' लौटाए, और साफ़ कहती है कि Astra, एक आगामी model, Hugging Face के exploitation में शामिल नहीं थी। Critical के लिए framework का text कहता है कि development तब तक रुके जब तक उस tier के safety standards specify न हों, और OpenAI की actions उस line से थोड़ा ही पीछे हैं: वह उन internal Astra activities को pause कर रही है जो अभी बढ़े हुए guardrails पर नहीं खड़ीं, test environments isolate कर रही है, network और tool access सीमित कर रही है, model weights को harden और encrypt कर रही है, और Astra के हर agentic use पर, training और evaluation समेत, एक universal monitor चला रही है, जिसमें Chain-of-Thought monitors high-risk activity को बीच में ही रोक देते हैं। Government agencies और select AI safety organizations को model test करने बुलाया जा रहा है, और third-party test partners को high-risk evaluations के लिए recommended controls मिल रहे हैं।
Sam Altman ने X पर practical consequence confirm किया: launch को 'a safe rollout के लिए थोड़ा और समय लगेगा, लेकिन hopefully बहुत ज़्यादा नहीं'। उसी post में उन्होंने Anthropic को निशाना बनाया, जो अपना सबसे मज़बूत model, Mythos, सिर्फ़ selected partners और governments को देती है: 'हम नहीं मानते कि capable models को सिर्फ़ कुछ powerful parties तक सीमित रखना कोई अच्छी strategy है।' OpenAI researcher Noam Brown ने अपने posts में Hugging Face incident को गंभीरता से लेने की अपील की, उसकी तुलना 2017 की उस कहानी से की जिसमें Facebook का AI कथित तौर पर अपनी भाषा बना लेता है, एक account जो overblown निकला। यह वाला, उन्होंने लिखा, वैसा नहीं है, और उन्होंने चिंता को test-time compute से जोड़ा, तर्क देते हुए कि current models को किसी भी plateau से पहले काफ़ी आगे धकेला जा सकता है।
मायने रखने वाली तौल दो सच्चे वाक्यों के बीच है। पहला: यह एक potential है, classification नहीं। OpenAI कहती है कि वह Critical rule out नहीं कर सकती; उसने Astra को Critical rate नहीं किया है, और अगर tier कभी नहीं पहुँचा, तो company एक ऐसे model के लिए बहुत सारा attention बनाएगी जिसे वह वैसे भी ship करेगी। The Decoder को fear-marketing के आरोप की उम्मीद है, और आरोप के साथ एक prediction जुड़ी है: अगर यह publicity है, तो pause cycle बीतते ही चुपचाप ख़त्म होगा। दूसरा: कोई framework तभी असली है जब उसकी कीमत हो, और इस हफ़्ते कीमत एक launch window और एक public admission थी, खुले camera पर, कि company का अगला model schedule पर release करने के लिए बहुत ज़्यादा capable हो सकता है। आगे देखने योग्य: क्या OpenAI final rating प्रकाशित करती है जब वह मौजूद हो, और क्या Anthropic और Google अब अपने frontier models को publicly rate करने के सवाल का सामना करेंगे, उसी framework भाषा के साथ या उसके बिना।
