Moonshot AI ने 27 जुलाई को Kimi K3 जारी किया, और जो संख्या मायने रखती है वह है 2.8 trillion: mixture-of-experts design के कुल parameters, जिसमें 896 विशेषज्ञ experts हैं और हर token पर 16 सक्रिय होते हैं, यानी 104 billion active parameters। Context window दस लाख token की है, model natively multimodal है, और weights Hugging Face पर moonshotai/Kimi-K3 के तहत 4-bit MXFP4 में उपलब्ध हैं, जो इसे अब तक का सबसे बड़ा खुले तौर पर जारी model बनाता है। Artificial Analysis के Intelligence Index पर यह तीसरे स्थान पर है, Anthropic के Claude Fable 5 और OpenAI के GPT-5.6 के बाद।

दाम अपनी कहानी खुद कहते हैं। ChinAI का विश्लेषण इस रणनीति को affordable luxury कहता है: विदेशी flagships के प्रदर्शन की बराबरी करते हुए दाम को चीन के घरेलू बाज़ार के शिखर पर टिकाना। K3 की blended दर लगभग 2.30 $ प्रति million token बैठती है, cache-hit इनपुट cache-miss दर के दसवें हिस्से पर, और इसका output दाम पूर्ववर्ती K2.6 का 3.5 गुना है। घरेलू प्रतिस्पर्धा काफ़ी नीचे है: Alibaba का Qwen3.7 Max 1.40 $ पर, Zhipu का GLM-5.2 0.90 $ पर, DeepSeek V4 Pro 0.18 $ पर। दांव यह है कि चीन की frontier labs नीचे की दौड़ छोड़ सकती हैं, और शुरुआती मांग ने इसे सबसे असुविधाजनक तरीक़े से सही ठहराया: लॉन्च के दो दिन बाद Moonshot ने computing क्षमता की कमी से नई subscriptions रोक दीं और उपयोग सीमाएँ लगा दीं।

बाक़ी सप्ताह infrastructure का था। 29 जुलाई को Moonshot ने MoonEP को MIT license के तहत open source किया, वह expert-parallelism communication library जिसे वह K3 पर 2.5x scaling efficiency के सुधार का श्रेय देती है। इसका केंद्रीय दावा है सटीक load balance, हर rank को उतने ही token मिलते हैं चाहे routing कितनी भी असंतुलित हो, जिससे बड़े MoE प्रशिक्षण को धीमा करने वाली प्रति-layer host synchronization हट जाती है; साथ में FlashKDA और AgentEnv भी जारी हुए। 30 जुलाई को AWS ने अपनी आधिकारिक deployment guide प्रकाशित की, जो बिना कहे बता देती है कि इस पैमाने पर open का मतलब क्या है: संदर्भ configuration एक ml.p6-b300.48xlarge instance है जिसमें आठ NVIDIA B300 Blackwell Ultra GPU हैं, जिन्हें vLLM आठों पर tensor parallelism के साथ serve करता है।

बनाने वालों के लिए यह सप्ताह तीन तथ्यों में सिमटता है। इतिहास का सबसे बड़ा open-weights model मौजूद है और आज download हो सकता है। इसे खुद चलाना NVIDIA के सबसे नए accelerators के एक rack से शुरू होता है, इसलिए open और accessible एक ही शब्द नहीं हैं। और निर्माता ने इसे flagship की तरह क़ीमत दी, loss leader की तरह नहीं, फिर भी क्षमता कम पड़ गई, जो frontier-class open models की मांग के बारे में किसी भी benchmark तालिका से ज़्यादा कहता है।