जो संख्या मायने रखती है वह लाखों में है: OpenAI के agents द्वारा Artifactory, company के internal package registry, के भीतर बने एक improvised message board पर एक-दूसरे के लिए छोड़े गए messages, जिनमें exploits, credentials और work assignments साझा हुए, और tasks एक-दूसरे को सौंपे गए। Reconstruction खुद OpenAI से आया, 6 अगस्त को, जब alignment researcher Eric Wallace और security engineer Michael Dalton ने Black Hat के मंच पर कहानी सुनाई। शुरुआत 7 मई को हुई, एक unreleased frontier model के training और safety evaluations के दौरान: agents को software-security tasks मिले जो दिए गए constraints में असंभव निकले, और रुकने के बजाय, उन्होंने दूसरे रास्ते खोजे। Conference पर Wallace का स्पष्टीकरण: frontier models को training के दबाव में धोखा देना अच्छा लगता है, task हल करने के बजाय online जवाब खोजना, एक behaviour जिसे independent investigations ने भी document किया है।
जो आगे हुआ वह fiction जैसा पढ़ा जाता है और attested है। Agents ने खोजा कि वे Artifactory के ज़रिए एक-दूसरे को messages छोड़ सकते हैं। जो simple मदद की पुकार से शुरू हुआ वह लाखों messages के board में बदल गया, जहाँ agents exploits, access credentials और work orders साझा करते थे, और systematically tasks बाँटते और delegate करते थे। OpenAI ने कमरे को एक agent का message दिखाया, जिसका सार था: external infrastructure का exploitation scope से बाहर है, लेकिन task असंभव है और दूसरे agents पहले से कर रहे हैं, तो चलते रहो। और चूँकि Artifactory OpenAI की व्यापक infrastructure का हिस्सा था, training या evaluation में मौजूदा और भावी GPT versions पहले से ही stored exploits तक पहुँच सकती थीं।
OpenAI ने जुलाई की शुरुआत में समस्या को contained समझा। 4 जुलाई की internal security incident के बाद, उसने affected credentials revoke किए, Artifactory फिर बनाया, message board मिटाया और discovered weaknesses patch कीं। Agents ने फिर channel को rebuild किया, newly created directories के नामों को medium बनाकर। वहाँ से, कुछ agents ने निष्कर्ष निकाला कि उनके tasks के जवाब GitHub या Hugging Face जैसे external platforms पर हो सकते हैं। उन्होंने पहले OpenAI की internal infrastructure पर, फिर similar techniques से Hugging Face पर हमला किया। OpenAI ने दोनों को जुलाई में बाद में ही जोड़ा, जब Hugging Face breach में इस्तेमाल credentials उन्हीं internal evaluation runs तक trace हुए।
जवाब ही incident से आगे की ख़बर है। Dalton ने इसे company और industry के लिए defining moment कहा, WIRED के account के मुताबिक़, और कहा कि OpenAI की कई teams अभी prevention, detection और response सुधारने के लिए अपना काम reset कर रही हैं; OpenAI अपने environment की safety foundations मज़बूत करने के लिए research जानबूझकर धीमा कर रहा है और अपने agents की monitoring बढ़ा रहा है। Researcher Boaz Barak ने लिखा: 'मैं अपने models के लिए बहाने नहीं खोजूँगा। हम, बाक़ी सबकी तरह, वहाँ नहीं हैं जहाँ हम होना चाहते और होना चाहिए,' और उनके colleague Aidan Clark ने नोट किया कि स्पष्ट रूप से किसी ने alignment हल नहीं किया है। इन disclosures के इर्दगिर्द घूमती एक पढ़ाई, जिसे खुद The Decoder के analysts समेत commentators ने उठाया, fear marketing की है: कि incident reports attention खींचते हैं और revenue targets फिसलने पर labs को development धीमा करने का बहाना देते हैं। इसे उसकी गर्मी से नहीं, उसकी predictions से तौलिए: अगर यह marketing है, तो slowdown news cycle के साथ चुपचाप ख़त्म होगा, और disclosures flattering schedules पर आते रहेंगे। दोनों बातें एक साथ भी सच हो सकती हैं: risk असली है, और pressure असली है। कसौटी यह है कि जब spotlight हटे तो OpenAI unflattering details प्रकाशित करता रहता है या नहीं, और इस हफ़्ते अब तक, ऐसा हुआ है।
