जो models publish हो रहे हैं और जो मशीनें ज़्यादातर लोगों के पास हैं, उनके बीच की खाई ही इस साल open weights की पूरी समस्या रही है। इस हफ़्ते की दो releases उसे दो अलग दिशाओं से घटाती हैं।

शुक्रवार को आया FreeToken वह है जिसे उसका README edge-native mixture-of-experts serving engine कहता है, UC Berkeley और MIT के शोधकर्ताओं का, जिनके लेखकों में Ion Stoica, Matei Zaharia, Song Han और Kurt Keutzer शामिल हैं, GitHub पर FlashML-org/FreeToken के रूप में Apache 2.0 के तहत, paper arXiv 2608.16157 पर। विचार compression नहीं, scheduling है। Static expert offloading में जैसे ही कोई ज़रूरी expert मौजूद नहीं होता GPU रुक जाता है, इसलिए FreeToken वह इस्तेमाल करता है जिसे paper q star policy कहता है: हर token की गणना को मापे गए PCIe throughput के आधार पर CPU cores और GPU tensor cores में बाँटना, साथ में एक fast weight format और पूरी layer का double buffering ताकि weights की streaming गणना के साथ ओवरलैप हो, और एक elastic memory manager जो चलते-चलते VRAM को KV cache और expert slots के बीच खिसकाता है। InfoQ संख्याएँ देता है: 8GB RTX 4060 laptop पर Qwen3.6-35B लगभग 39 tokens प्रति सेकंड, RTX 5090 desktop पर 284 billion parameters वाला DeepSeek-V4-Flash, एक ही workstation GPU पर 753 billion वाला GLM-5.2, और Ollama तथा llama.cpp के मुक़ाबले 3 से 4 गुना तेज़ decode और 6 से 30 गुना तेज़ prefill। Support में Linux और Windows पर RTX 30, 40 और 50 series शामिल हैं, MXFP4, NVFP4, FP8 और BF16 weights के साथ।

दूसरी दिशा quantization है। Unsloth ने गुरुवार को GLM-5.3-Flash का 3-bit GGUF publish किया, वही model जिसे Z.ai ने इस हफ़्ते Ox Alpha के रूप में उजागर किया, जो छह दिन OpenRouter के शीर्ष पर रहा था। AI Times file को लगभग 120GB बताता है, पूर्ण-परिशुद्धता release से क़रीब 81 प्रतिशत छोटा, जो Mac Studio या workstation जैसी 128GB मशीन पर बिना GPU के चलता है, और Unsloth दावा करता है कि layer-selective quantization तथा output distribution को क़रीब रखने के लिए KL divergence की निगरानी से BF16 model का 82 प्रतिशत प्रदर्शन बना रहता है। यह दावा vendor का अपना है, वैसे ही जैसे Z.ai के model card की वह पंक्ति कि GLM-5.3-Flash coding और agentic benchmarks पर Claude Opus 4.8 के क़रीब पहुँचता है।

दोनों को साथ रखिए और व्यावहारिक तस्वीर बदल जाती है। MIT weights वाला 320 billion parameter का multimodal model, एक engine जो consumer GPU और उसके host CPU को एक ही scheduling समस्या मानता है, और एक quantization जो पूरी चीज़ को system RAM में समा देती है: frontier स्तर अभी local नहीं हुआ, पर उसके ठीक नीचे वाला स्तर अब एक अच्छे desktop पर चलता है। देखने लायक यह है कि क्या स्वतंत्र benchmarks इन throughput दावों को दोहरा पाते हैं, और 3-bit रास्ता perplexity पर नहीं बल्कि असली काम पर कितनी गुणवत्ता की क़ीमत लेता है।