जो संख्या मायने रखती है वह है 284 billion: DeepSeek के V4 Flash mixture-of-experts backbone के भीतर के parameters, जिनमें से किसी एक prompt पर केवल लगभग 13 billion activate होते हैं। यही backbone V4 Flash Vision Exp की foundation है, वह multimodal agent model जो DeepSeek ने शुक्रवार को अपने paid developer platform पर पेश किया। "Exp" tag ईमानदारी से काम कर रहा है: company ने नए model के लिए कोई architecture notes प्रकाशित नहीं किए हैं, और उसकी हमेशा की open-weights release की पुष्टि नहीं हुई है, जो उस lab के लिए एक उलटाव है जिसकी drops आमतौर पर checkpoint से शुरू होती हैं।
vendor की benchmark sheet सटीक है। अपने ही predecessor के मुकाबले Vision Exp सात में से छह text benchmarks जीतता है, इकलौती हार Cybergym पर आती है, जो software-vulnerability discovery मापता है। बढ़त वहीं केंद्रित है जहाँ नाम कहता है: चार visual benchmarks में model दो पर V4 Flash से 10 प्रतिशत से अधिक सुधारता है, और SiliconANGLE की report के अनुसार यह ALE पर भी Anthropic के Opus 4.8 को पीछे छोड़ता है, ALE में 1,000 से अधिक multi-step tasks हैं जो applications से interact करने, code लिखने और media interpret करने की मांग करते हैं, और ZeroBench पर, जिसमें 100 image-analysis tasks हैं जो frontier models के लिए कठिन बनाए गए हैं। इनमें से किसी की भी स्वतंत्र evaluation अभी नहीं हुई है; third-party runs आने तक charts को दावे मानिए।
नीचे वह engineering है जिसे April में V4 Flash model card ने document किया था: HCA और CSA, दो KV-cache compression तकनीकें जो million-token prompts के लिए ज़रूरी compute को लगभग तीन-चौथाई घटाती हैं, 32 trillion tokens पर training, और hidden-layer calibration तेज़ करने के लिए Muon optimizer। DeepSeek का बड़ा V4 Pro, जिसमें पाँच गुना से अधिक parameters हैं, उसी vision treatment का स्पष्ट उम्मीदवार है यदि Vision Exp का pattern टिकता है।
builders के लिए कहानी computer-use agents की price-performance दिशा है। DeepSeek जैसी cost structure वाले lab का screen-reading agent model उस धारणा पर दबाव डालता है कि गंभीर visual agent काम के लिए flagship budget ज़रूरी है; Canaltech की coverage ठीक यही use case बताती है, screens देखकर solve किए गए tasks। दो बातों पर नज़र रखिए: क्या स्वतंत्र benchmarks Opus 4.8 वाली तुलनाएँ confirm करते हैं, और क्या weights आते हैं, क्योंकि 13 billion active parameters वाला एक downloadable screen-reader local-agent tier को फिर हिला देगा, Muse Glimmer और Qwen 3.8 के ठीक दो हफ़्ते बाद।
