Gemma
यह क्यों मायने रखता है
गहन अध्ययन
Gemma, 2024 में open-weight model race में Google की entry के रूप में आया, जिसे Llama ने एक साल पहले शुरू किया था। Google DeepMind ने इसे उसी research और technology से बनाया जिससे Gemini models बने, और यह तीन generations से गुज़रा है: मूल Gemma (2B और 7B पैरामीटर), Gemma 2 (9B और 27B), तथा Gemma 3 (1B, 4B, 12B और 27B), जिसने image understanding, 128k-token context window और 140 से अधिक भाषाओं का support जोड़ा। सभी Gemma models decoder-only Transformer हैं जिन्हें Google के TPU पर train किया गया है, और सभी commercial use की अनुमति देने वाले custom license के तहत downloadable weights के रूप में जारी होते हैं। पेशकश सरल है: frontier lab की training pipeline की quality लें और उसे इतना छोटा कर दें कि आप वास्तव में खुद चला सकें।
Size चुनना
नाम में मौजूद संख्या पैरामीटर count बताती है, और हर tier अलग machine को लक्ष्य करता है। 1B मॉडल phones और browsers में भी आराम से चलता है, 4B laptops और छोटे edge boxes के लिए अच्छा fit है, 12B एक consumer GPU पर fine-tuning का लोकप्रिय base है, और 27B flagship को workstation GPU या छोटे server की ज़रूरत होती है लेकिन वह अपने से कई गुना बड़े proprietary models के क़रीब quality देता है। चूँकि एक generation के हर size में वही architecture, tokenizer और training recipe होती है, बाद में सीढ़ी पर ऊपर या नीचे जाना rebuild नहीं बल्कि configuration change है। असली निर्णय प्रति request quality और hardware budget के बीच है — और on-device उपयोग में battery तथा memory भी इसमें शामिल हैं।
इतना छोटा कि कहीं भी चल सके
Gemma का अधिकतर उपयोग data centers के बाहर होता है। 4 bits तक क्वांटाइज़ेशन करने पर 4B मॉडल कुछ gigabytes तक सिमट जाता है, यानी वह आधुनिक laptop या flagship phone पर पढ़ने योग्य गति से चलता है, और community tooling भारी काम करती है: llama.cpp और Ollama हर Gemma size के लिए ready-to-run GGUF builds देते हैं। यह छोटा भाषा मॉडल वाली धारणा का ठोस रूप है — आपके नियंत्रण वाला मॉडल, जो offline काम करता है, user data को device पर रखता है और प्रति request कुछ खर्च नहीं करता। Privacy-sensitive apps, offline tools और embedded assistants के लिए यह मेल अक्सर benchmark quality के आख़िरी कुछ points से अधिक महत्वपूर्ण होता है। Google अपनी mobile और browser runtime support से इस कहानी को और मज़बूत करता है, जो दूसरे open-weight families की तुलना में असाधारण रूप से polished है।
Fine-tuning ही मुख्य आकर्षण है
Weights downloadable होने के कारण Gemma ecosystem के सबसे अधिक fine-tune किए गए model families में से एक बन गया है। LoRA जैसे parameter-efficient methods किसी practitioner को 4B या 12B Gemma को किसी niche काम — support bot की voice, legal summarizer या specialized classifier — के लिए एक GPU पर कुछ घंटों में adapt करने देते हैं, और Hugging Face शुरुआत के लिए हज़ारों community fine-tunes host करता है। Google अपने derivatives भी जारी करता है: code के लिए CodeGemma, vision-language tasks के लिए PaliGemma और safety classification के लिए ShieldGemma। Base models की ताक़त का कुछ हिस्सा डिस्टिलेशन से भी आता है, जहाँ बड़े teacher के outputs छोटे मॉडल को train करने में मदद करते हैं — यही एक कारण है कि Gemma अपने parameter count से अपेक्षित स्तर से लगातार बेहतर करता है।
Open weights का अर्थ open source नहीं
एक आम गलतफ़हमी है कि Gemma open source है। यह ओपन वेट्स है, जो अलग बात है: Google files को Gemma Terms of Use नामक custom license के तहत जारी करता है, जो commercial use, modification और redistribution की अनुमति देता है, लेकिन prohibited-use policy जोड़ता है और उसके उल्लंघन वाले उपयोग को रोकने का अधिकार सुरक्षित रखता है। रोज़मर्रा के व्यवहार में यह शायद ही किसी को रोकता है — बहुत-सी startups अनुमति माँगे बिना Gemma पर commercial products ship करती हैं — लेकिन यह Apache 2.0 जैसी स्वतंत्रता नहीं है, जिसका Qwen अपने अधिकतर models के लिए उपयोग करता है, और यदि आपकी legal team license purity की परवाह करती है तो यह अंतर मायने रखता है। यही nuance Meta के Llama license पर भी लागू होता है: open weights बताता है कि आप क्या download कर सकते हैं, उससे जुड़ी शर्तें नहीं। जब लोग "open model" कहें तो पूछना उपयोगी है कि इन दोनों में से उनका मतलब क्या है।
Gemma कहाँ fit होता है
Gemma छोटे Llama models, Qwen और Microsoft के Phi वाली भीड़भरी श्रेणी में प्रतिस्पर्धा करता है, और ईमानदार निष्कर्ष यह है कि हर release के साथ ये families एक-दूसरे को पीछे छोड़ते रहते हैं। Gemma की अलग ताक़त उसकी training pedigree है — बहुत कम छोटे models frontier lab की पूरी pipeline से आते हैं — और on-device deployment के लिए first-party support। इसकी सीमाएँ इसके size का दूसरा पहलू हैं: परिवार का कोई मॉडल सबसे कठिन reasoning problems पर frontier models को चुनौती नहीं देता, और किसी भी छोटे मॉडल की तरह इसमें world knowledge कम होता है तथा अपने बड़े रिश्तेदारों से अधिक आसानी से hallucinate करता है। Teams आम तौर पर Gemma चुनती हैं जब उन्हें ऐसा सक्षम और सस्ता base model चाहिए जिसका end-to-end स्वामित्व उनके पास हो, और hosted API model तब चुनती हैं जब task को frontier system की पूरी क्षमता चाहिए।