मुख्य सामग्री पर जाएँ
Zubnet AIसीखेंWiki › Qwen
मॉडल

Qwen

इसे भी कहा जाता है: Tongyi Qianwen
Qwen Alibaba Cloud द्वारा विकसित ओपन-वेट बड़े भाषा मॉडलों का एक परिवार है। इस शृंखला में कई पीढ़ियाँ शामिल हैं — Qwen 1.5, 2, 2.5, और 3 — जिनके आकार आधे अरब से लेकर सैकड़ों अरब पैरामीटर तक हैं, और ये dense और mixture-of-experts दोनों डिज़ाइनों में उपलब्ध हैं। अधिकांश रिलीज़ उदार Apache 2.0 लाइसेंस के तहत आती हैं, इसलिए इन्हें बिना कोई उपयोग शुल्क दिए चलाया, संशोधित और व्यावसायिक रूप से तैनात किया जा सकता है।

यह क्यों मायने रखता है

Qwen उपलब्ध सबसे मज़बूत ओपन-वेट परिवारों में से एक है, यही वजह है कि यह उन टीमों के लिए एक डिफ़ॉल्ट शुरुआती बिंदु बन गया है जो प्रति-टोकन API शुल्क चुकाने के बजाय ऐसा सक्षम मॉडल चाहती हैं जिसे वे खुद चला सकें या फ़ाइन-ट्यून कर सकें। इसके मॉडल विशेष रूप से बहुभाषी काम, कोडिंग और गणित में अच्छे हैं, और आकारों की विविधता का मतलब है कि आम तौर पर कोई न कोई variant किसी दिए गए GPU बजट में फ़िट बैठ जाता है। चूँकि वेट्स डाउनलोड किए जा सकते हैं, एक Qwen मॉडल सिर्फ़ एक endpoint नहीं बल्कि आपके अपने विशिष्ट मॉडल का आधार भी बन सकता है।

गहन अध्ययन

Qwen एक मॉडल नहीं बल्कि एक पूरी प्रोडक्ट लाइन है, और इसकी naming scheme को समझ लेने से इसे navigate करना काफ़ी आसान हो जाता है। Qwen2.5-7B-Instruct जैसा कोई typical रिलीज़ नाम आपको पीढ़ी (2.5), पैरामीटर संख्या (7 अरब), और variant बताता है: Instruct का मतलब है निर्देशों का पालन और chat के लिए ट्यून किया हुआ, जबकि Base वह raw प्री-ट्रेन्ड मॉडल है जो आगे की ट्रेनिंग की नींव के रूप में बनाया गया है। हर पीढ़ी एक साथ कई आकारों में आती है, ताकि आप एक छोटे मॉडल से prototype कर सकें और टूलिंग बदले बिना ऊपर scale कर सकें। वेट्स Hugging Face और Alibaba के अपने ModelScope hub पर प्रकाशित होते हैं, और ये हर बड़े serving stack के लिए packaged हैं — laptop पर Ollama से लेकर production में vLLM clusters तक।

पीढ़ियाँ और आकार

परिवार ने तेज़ी से लगातार चार प्रमुख पीढ़ियाँ पार की हैं: 1.5, 2, 2.5, और 3। हर पीढ़ी ने अधिक ट्रेनिंग डेटा, लंबी कॉन्टेक्स्ट विंडो, और बेहतर instruction tuning लाई, और हर एक आकारों की एक सीढ़ी में आई — उदाहरण के लिए 2.5 लाइन में इसका मतलब था लगभग 0.5B, 1.5B, 3B, 7B, 14B, 32B, और 72B पैरामीटर वाले dense मॉडल। छोटे मॉडल laptops और edge devices को लक्ष्य करते हैं, मध्यम रेंज वाले वही workhorse हैं जिन्हें लोग फ़ाइन-ट्यून करते हैं, और बड़े मॉडल frontier मॉडलों से प्रतिस्पर्धा करते हैं। Qwen 3 ने इस मिश्रण में मिक्सचर ऑफ़ एक्सपर्ट्स flagships भी जोड़े: शीर्ष मॉडल में कुल 235 अरब पैरामीटर हैं लेकिन यह प्रति टोकन केवल लगभग 22 अरब activate करता है, जिससे इन्फ़ेरेंस लागत एक बहुत छोटे dense मॉडल के करीब रहती है।

Qwen 3 ने एक hybrid thinking mode भी पेश किया, जहाँ एक ही मॉडल या तो सीधे जवाब दे सकता है या जवाब देने से पहले चरण-दर-चरण तर्क करने में अतिरिक्त compute खर्च कर सकता है — इसे prompt या chat template में एक flag से नियंत्रित किया जाता है। इसने chat मॉडल और dedicated reasoning मॉडल के बीच की सीमा को धुंधला कर दिया, और यह तब से पूरे उद्योग में एक आम pattern बन गया है।

विशेषज्ञ variants

मुख्य chat मॉडलों के इर्द-गिर्द, Alibaba विशिष्ट कामों के लिए प्रशिक्षित specialist लाइनें जारी करता है। Qwen-Coder series प्रोग्रामिंग को लक्ष्य करती है — autocomplete से लेकर agentic coding tasks तक — और dedicated code मॉडलों से सीधे प्रतिस्पर्धा करती है। QwQ reasoning लाइन है, जिसे गणित और तर्क की समस्याओं को जवाब देने से पहले लंबी chains of thought से सुलझाने के लिए प्रशिक्षित किया गया है; इसकी अधिकांश क्षमता बाद में Qwen 3 के thinking mode में वापस समा गई। मल्टीमॉडल तरफ़, Qwen-VL images और documents संभालता है, और audio तथा math-focused रिलीज़ भी हैं, साथ ही retrieval pipelines के लिए embedding और reranking मॉडल भी। अगर किसी workload का कोई नाम है, तो आम तौर पर उसके लिए कोई Qwen variant मौजूद है।

यह सिर्फ़ एक चीनी मॉडल नहीं है

एक आम गलतफ़हमी यह है कि Qwen मुख्य रूप से तभी उपयोगी है जब आप चीनी में काम करते हों, क्योंकि यह एक चीनी कंपनी का बनाया है। व्यवहार में यह उपलब्ध सबसे बहुभाषी परिवारों में से एक है: मॉडलों को दर्जनों भाषाएँ संभालने के लिए प्रशिक्षित किया गया है, अंग्रेज़ी क्षमता सचमुच मज़बूत है, और Hugging Face पर Qwen को फ़ाइन-ट्यून करने वालों का एक बड़ा हिस्सा चीनी को छूता भी नहीं। दूसरी चिंता जो उठती है वह है provenance की — क्या किसी विदेशी vendor का मॉडल अपनाने से डेटा-एक्सपोज़र जोखिम पैदा होता है। ओपन वेट्स के साथ यह चिंता काफ़ी हद तक समाप्त हो जाती है, क्योंकि मॉडल आपके अपने hardware पर चलता है और कोई prompt डेटा आपकी machines से बाहर नहीं जाता; weight फ़ाइल तो बस अंकों का एक समूह है।

लाइसेंसिंग और इसे खुद चलाना

अधिकांश Qwen रिलीज़ Apache 2.0 के तहत आती हैं, जो उद्योग के सबसे उदार लाइसेंसों में से एक है और व्यावसायिक उपयोग, संशोधन तथा पुनर्वितरण की अनुमति देता है। कुछ आकार और research variants Alibaba के अपने लाइसेंसों के तहत अतिरिक्त शर्तों के साथ आए हैं, इसलिए जिस रिलीज़ को आप ship करने की योजना बना रहे हैं उसका model card ज़रूर देख लें। रोज़मर्रा में, व्यावहारिक कहानी सरल है: quantized GGUF builds llama.cpp या Ollama के माध्यम से locally चलते हैं, और production deployments आम तौर पर full-precision या FP8 वेट्स को vLLM या SGLang के माध्यम से serve करते हैं। 4-bit तक क्वांटाइज़ेशन करने से memory footprint लगभग चार गुना घट जाता है और गुणवत्ता पर केवल मामूली असर पड़ता है — यही तरीका है जिससे एक 32B मॉडल एक ही high-end consumer GPU में समा जाता है।

ओपन इकोसिस्टम में इसकी जगह

Qwen उसी open-weight अखाड़े में प्रतिस्पर्धा करता है जहाँ Llama, Mistral, Gemma, और DeepSeek हैं, और इसकी रिलीज़ नियमित रूप से Chatbot Arena जैसे public leaderboards में उन मॉडलों के बीच शीर्ष के पास पहुँचती हैं जिनके वेट्स आप वास्तव में डाउनलोड कर सकते हैं। इसका गहरा प्रभाव एक नींव के रूप में है: उदार लाइसेंस और मज़बूत छोटे मॉडलों ने Qwen को community फ़ाइन-ट्यूनिंग के लिए सबसे लोकप्रिय आधारों में से एक बना दिया है, और अन्य labs भी इस पर बनाती हैं — DeepSeek ने अपना R1 reasoning मॉडल Qwen आकारों में डिस्टिलेशन के रूप में जारी किया, जो इस बात का खूब प्रमाण है कि उद्योग किनके वेट्स पर भरोसा करता है। अगर आप आज कोई ओपन-वेट base मॉडल चुन रहे हैं, तो Qwen लगभग डिफ़ॉल्ट रूप से shortlist में होता है।

← सभी शब्द
ESC