वह launch जो हम cover नहीं कर सके: Anthropic ने शुक्रवार 24 जुलाई को Claude Opus 5 निकाला, और जो संख्या मायने रखती है वह है दो, उसका और उस flagship का दाम-गुणक जिसकी छाया में यह चलता है। Anthropic की positioning है 'Claude Fable 5 की frontier intelligence के क़रीब, आधे दाम पर', Opus 4.8 जैसे ही $5 प्रति million input tokens और $25 output पर, Fast mode के साथ जो दोगुने दाम पर लगभग 2.5 गुना रफ़्तार देता है। यह अब Claude Max का default model है, Pro का सबसे मज़बूत, और उसी दिन AWS Bedrock पर 1M-token context के साथ उपलब्ध हुआ।
दावे किए गए आँकड़े, Anthropic की release post से: Frontier-Bench और GDPval-AA पर नया state of the art, CursorBench 3.2 में Fable 5 के peak के 0.5% के भीतर, आधे cost per task पर, OSWorld 2.0 में Fable 5 के best से ऊपर, लागत के एक-तिहाई से थोड़ा ऊपर पर, और ARC-AGI-3 में वह score जिसे Anthropic ने अगले best model से तीन गुना बताया, public task set पर 30.2%। स्वतंत्र पढ़ाई marketing से ज़्यादा दयालु थी: Artificial Analysis ने इसे अपने Intelligence Index में Fable 5 से क़सकर आगे रखा, 61 से 60, effectively tied, और अपने agentic benchmark AA-Briefcase में साफ़ आगे, 1,720 से 1,574, लगभग 20% कम cost per task के साथ; Epoch ने इसका software-engineering score Fable 5 के बराबर रखा। Anthropic यह भी कहती है कि उसने जानबूझकर Opus 5 को cyber tasks पर train नहीं किया; यह वहाँ Mythos 5 से काफ़ी पीछे है। Simon Willison द्वारा उजागर किया गया release का एक detail: एक Frontier-Bench task में machine-part का drawing देखने का कोई तरीक़ा न होने पर, Opus 5 ने raw pixels से geometry निकालने के लिए अपना computer-vision pipeline खुद लिख दिया।
जवाब में पाँच दिन लगे। 29 जुलाई को OpenAI ने छापा 'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark': GPT-5.6 Sol OpenAI की अपनी public-set re-run पर 13.3% बनाता है, official leaderboard के 7.8% के मुक़ाबले, लेकिन Responses API की दो settings चालू होते ही 38.3%, Opus 5 के 30.2% से ऊपर, एक retained reasoning, जो tool calls के बीच private reasoning बचाकर रखता है, और compaction, जो लंबे contexts को काटने के बजाय summarize करता है। Model के वही weights, output tokens लगभग छह गुना कम, score लगभग तीन गुना। ARC Prize के Francois Chollet ने रेखा वहीं खींची जहाँ बहस अब रहती है: score के लिए बनाए custom harnesses बाहर, हर ग्राहक के चालू करने योग्य general-purpose API settings अंदर, और OpenAI के आँकड़े तब तक मान्य जब तक settings और cost साफ़ बताए जाएँ। उन्होंने parity का सवाल भी माना: official harness model का अपना बनाया reasoning फेंक देता है, यह test के बारे में फ़ैसला है, weights के बारे में नहीं।
तो दोनों आँकड़े दर्ज कीजिए। Opus 5 का 30.2% उस harness पर जो हर step के बाद उसका reasoning फेंक देता है, और GPT-5.6 Sol का 38.3% उस पर जो नहीं फेंकता, दोनों सच हैं, और दोनों एक ही test का वर्णन नहीं करते। इस launch week का काम का सबक़ यह नहीं कि कौन जीता; यह है कि अब से हर frontier benchmark नतीजा दो columns में आता है, model और उसके चारों ओर का मचान, और दूसरा column वह बनता जा रहा है जो आँकड़ा हिलाता है। जब कोई vendor आपको score सुनाए, पहले follow-up सवाल का आकार अब तय है: किस harness के साथ, और किसका।
