Llama
यह क्यों मायने रखता है
गहन अध्ययन
Llama कोई एक मॉडल नहीं बल्कि Meta AI की releases की वंशावली है, और परिवार को समझने के लिए दो धाराओं को साथ देखना पड़ता है: Llama 1 से Llama 4 तक की technical line और वह licensing line जिसने research artifact को उद्योग के साझा आधार में बदल दिया। हर release downloadable weights, tokenizer और reference code के साथ आती है, इसलिए पर्याप्त GPU memory वाला कोई भी व्यक्ति — या छोटे sizes के लिए सामान्य laptop वाला — मॉडल को locally चला, fine-tune, quantize या product में embed कर सकता है। भरोसेमंद quality और पूरे local control का यही मेल Llama को ओपन वेट्स ecosystem का reference point बनाता है: Mistral, Qwen या DeepSeek का नया मॉडल आते ही practitioners का पहला सवाल होता है कि वह समान size के Llama के सामने कैसा है।
Research leak से product family तक
फरवरी 2023 में जारी मूल LLaMA केवल research के लिए था: 7B से 65B पैरामीटर तक के sizes, application form के पीछे सीमित access और non-commercial license। पूरे weights कुछ दिनों में leak हो गए, जिससे अनजाने में दिख गया कि ऐसे सक्षम मॉडल की कितनी माँग थी जिसे लोग खुद चला सकें। Meta ने जुलाई 2023 में Llama 2 के साथ उस माँग को अपनाया और 7B, 13B तथा 70B sizes ऐसे license पर जारी किए जो अधिकतर commercial use की अनुमति देता था, साथ में RLHF से tune किए chat variants भी थे। 2024 की Llama 3 generation ने स्तर फिर ऊँचा किया और लगभग 15 trillion tokens पर train हुई: पहले 8B व 70B sizes, फिर Llama 3.1 में 405B flagship, 3.2 में छोटे 1B व 3B text models तथा vision-capable 11B व 90B versions, और 3.3 में efficiency पर केंद्रित 70B मॉडल। Llama 4, 2025 में मिक्सचर ऑफ़ एक्सपर्ट्स architecture के साथ आया: Scout और Maverick released models थे, जबकि कहीं बड़ा Behemoth अभी training में मौजूद teacher model के रूप में बताया गया।
वह architecture जो default बन गया
Architecture के स्तर पर Llama decoder-only Transformer है, और हर generation क्रांतिकारी होने के बजाय क्रमिक है: RMSNorm के साथ pre-normalization, rotary positional embeddings, SwiGLU feed-forward layers, और Llama 2 के 70B से आगे inference के समय KV cache छोटा रखने के लिए GQA। इन विकल्पों में से किसी का आविष्कार Meta में नहीं हुआ, लेकिन Llama की लोकप्रियता ने इन्हें de facto recipe बना दिया, और अब लोग उसी template वाले दूसरे models को सहज ही Llama-architecture कहते हैं। इस standardization का वास्तविक व्यावहारिक मूल्य है: vLLM, SGLang और llama.cpp जैसी inference stacks सबसे पहले और सबसे गहराई से Llama-shaped models के लिए optimize होती हैं, और कुछ labs जानबूझकर releases को Llama-compatible रखती हैं ताकि tooling बिना परेशानी काम करे। Llama 3 की 128k-token vocabulary और 3.1 के साथ आई 128k-token context window भी ऐसे reference points बने जिनसे दूसरे open models को मापा जाता है।
Open weights, open source नहीं है
एक लगातार बनी गलतफ़हमी यह है कि Llama open source है। कम-से-कम Open Source Initiative की परिभाषा के अनुसार ऐसा नहीं है: Meta का Llama Community License models को इस्तेमाल, modify और redistribute करने के व्यापक अधिकार देता है, लेकिन उसमें field-of-use restrictions हैं जिन्हें OSI के मानदंड स्वीकार नहीं करते। 70 करोड़ से अधिक monthly active users वाली companies को Meta से अलग license चाहिए, Acceptable Use Policy कुछ applications को रोकती है, और derivative models के नाम में Llama होना तथा Built with Llama attribution दिखाना आवश्यक है। कुछ releases में क्षेत्रीय पेच भी हैं — उदाहरण के लिए multimodal Llama 3.2 models EU में domiciled companies को licensed नहीं हैं। किसी individual developer या छोटी startup के लिए व्यवहार में यह आम तौर पर मायने नहीं रखता, लेकिन legal teams ठीक इसी fine print की चिंता करती हैं, और यह ओपन बनाम क्लोज़्ड (Open vs. Closed) spectrum का सबसे स्पष्ट उदाहरण है: downloadable weights, Apache 2.0 या MIT license के समान नहीं होते।
Weights के इर्द-गिर्द ecosystem
Weights स्वयं कहानी का केवल आधा हिस्सा हैं; उनके आसपास बनी tooling और derivatives शायद Llama का सबसे बड़ा योगदान हैं। Llama 1 leak के कुछ सप्ताह के भीतर Alpaca और Vicuna जैसे projects ने दिखाया कि synthetic data पर सस्ता instruction-tuning run base model को उपयोगी chatbot में बदल सकता है, और इसी ने आधुनिक फ़ाइन-ट्यूनिंग wave शुरू की। Georgi Gerganov के llama.cpp ने consumer CPU और laptops पर quantized Llama models चलाना संभव बनाया, जिससे GGUF format और Ollama सहित पूरी local-inference stack पैदा हुई, जबकि Hugging Face अब हज़ारों Llama fine-tunes, merges और quantizations host करता है। Distillation और model merging के कारण कई कथित नए open models अंदर से Llama derivatives हैं। यह network effect खुद को मज़बूत करता है: क्योंकि हर कोई पहले Llama के लिए बनाता है, Llama चुनने पर सबसे अच्छा tooling support मिलता है, और यही उसे तब भी default बनाए रखता है जब कोई competitor benchmark में थोड़े बेहतर numbers दे दे।