लोकल एआई · Hugging Face & Alibaba Qwen Official
Qwen 2.5: Alibaba के ओपन LLM की पूर्ण गाइड
फोटो: Bhautik Patel Unsplash पर
Qwen2.5 Qwen बड़े भाषा मॉडलों की नवीनतम श्रृंखला है, जो 0.5B से 72B पैरामीटर तक 7 आकारों में उपलब्ध है। मॉडलों को 18 ट्रिलियन टोकन पर प्रशिक्षित किया गया है और ये 29+ भाषाओं का समर्थन करते हैं, अधिकांश आकारों के लिए Apache 2.0 लाइसेंसिंग के साथ। Qwen2.5 इन क्षेत्रों में विशेष विशेषज्ञ मॉडलों की बदौलत कोडिंग और गणित में काफी बेहतर क्षमताएँ लाता है।
Qwen 2.5 क्या है?
Qwen2.5 Qwen बड़े भाषा मॉडलों की नवीनतम श्रृंखला है। 18 ट्रिलियन टोकन और पर्यवेक्षित फाइन-ट्यूनिंग तथा बहु-चरणीय रीइन्फोर्समेंट लर्निंग सहित परिष्कृत पोस्ट-ट्रेनिंग तकनीकों पर निर्मित, Qwen2.5 बड़े स्वामित्व वाले सिस्टमों से प्रतिस्पर्धा करने वाले प्रतिस्पर्धी ओपन-वेट मॉडल बनाने की Alibaba की दिशा को दर्शाता है।
Qwen2.5 इन क्षेत्रों में विशेष विशेषज्ञ मॉडलों की बदौलत कोडिंग और गणित में काफी बेहतर क्षमताएँ लाता है। यह निर्देश अनुसरण, लंबे टेक्स्ट निर्माण (8K टोकन से अधिक), संरचित डेटा (जैसे तालिकाएँ) को समझने और संरचित आउटपुट, विशेष रूप से JSON प्रारूप में, उत्पन्न करने में महत्वपूर्ण प्रगति प्रदर्शित करता है।
उपलब्ध आकार और संस्करण
Qwen2.5 7 आकारों में प्री-ट्रेंड और इंस्ट्रक्शन-ट्यून्ड मॉडल प्रदान करता है: 0.5B, 1.5B, 3B, 7B, 14B, 32B और 72B। एक ही रिलीज़ में 100 से अधिक मॉडल उपलब्ध हैं, जिनमें सात पैरामीटर आकारों में बेस और इंस्ट्रक्ट संस्करण, साथ ही विशेष Qwen2.5-Coder और Qwen2.5-Math संस्करण, तथा GGUF, AWQ और GPTQ क्वांटाइज़्ड संस्करण शामिल हैं।
बेस बनाम इंस्ट्रक्शन-ट्यून्ड मॉडल:
- बेस मॉडल प्री-ट्रेंड हैं और निरंतर फाइन-ट्यूनिंग के लिए उपयुक्त हैं
- इंस्ट्रक्शन-ट्यून्ड संस्करण चैट और बातचीत के लिए अनुकूलित हैं (अधिकांश उपयोगकर्ताओं के लिए अनुशंसित)
विशेष संस्करण:
- Qwen2.5-Coder विशेष रूप से कोडिंग अनुप्रयोगों के लिए डिज़ाइन किया गया है
- Qwen2.5-Math एक Chain-of-Thought + Tool-Integrated Reasoning पाइपलाइन के साथ विशेष गणित-तर्क फाइन-ट्यून प्रदान करता है
लाइसेंसिंग:
- अधिकांश मॉडल Apache 2.0 के तहत लाइसेंस प्राप्त हैं, जबकि Qwen2.5-3B और Qwen2.5-72B क्रमशः Qwen Research License और Qwen License द्वारा शासित हैं
हार्डवेयर आवश्यकताएँ
0.5B (लैपटॉप/फोन/Pi) से 72B (डुअल-3090 फ्लैगशिप) तक की श्रेणी का अर्थ है कि हर सेटअप के लिए एक Qwen 2.5 संस्करण मौजूद है। यहाँ लोकप्रिय क्वांटाइज़ेशन पर विशिष्ट VRAM आवश्यकताएँ हैं:
| मॉडल | Q4_K_M (अनुशंसित) | FP16 (पूर्ण परिशुद्धता) | न्यूनतम GPU |
|---|---|---|---|
| 0.5B | ~400MB | ~1GB | Raspberry Pi 5 / फोन |
| 1.5B | ~1.5GB | ~3GB | 4GB RAM |
| 3B | ~2GB | ~6GB | 8GB RAM |
| 7B | ~5.5GB | ~14GB | RTX 4060 (8GB) |
| 14B | ~8.5GB | ~28GB | RTX 4070 (12GB) |
| 32B | ~19.5GB | ~64GB | RTX 4090 (24GB) |
| 72B | ~45GB | ~144GB | Dual A100 (40GB) |
अधिकांश मॉडल 128K (131,072) टोकन की संदर्भ लंबाई का समर्थन करते हैं और 8K टोकन तक उत्पन्न कर सकते हैं, जो व्यापक टेक्स्ट आउटपुट के निर्माण को सक्षम बनाता है।
क्वांटाइज़ेशन सुझाव:
- Q4_K_M गुणवत्ता बनाम VRAM समझौते के लिए अनुशंसित मध्य-मार्ग है
- Q8_0 अधिक सटीकता बनाए रखता है लेकिन 2x VRAM की आवश्यकता होती है
- Q3/Q2 क्वांटाइज़ेशन तंग मेमोरी के लिए आपातकालीन विकल्प हैं
बेंचमार्क की मुख्य बातें
Qwen2.5 मानक मूल्यांकनों में प्रतिस्पर्धी प्रदर्शन दिखाता है:
- MATH बेंचमार्क पर, Qwen2.5-7B/72B-Instruct के स्कोर 52.9/69.0 से बढ़कर 75.5/83.1 हो गए हैं
- Qwen2.5-72B MMLU और BBH जैसे सामान्य कार्यों में उत्कृष्ट है, 79.7 और 78.2 स्कोर प्राप्त करते हुए, बड़े आकार के प्रतिस्पर्धियों को पीछे छोड़ता है
- Qwen2.5-14B और Qwen2.5-32B तुलनीय या बड़े आकार के बेसलाइन मॉडलों से बेहतर प्रदर्शन करते हैं, मॉडल आकार और क्षमता के बीच इष्टतम संतुलन प्राप्त करते हुए
कोडिंग प्रदर्शन:
- Qwen 2.5-Coder-32B LiveCodeBench पर 37.2% स्कोर करता है, GPT-4o के 29.2% को पीछे छोड़ते हुए
- 72B मॉडल का SWE-Bench Verified (वास्तविक दुनिया की बग फिक्सिंग) पर 36.5% स्कोर GPT-4o के 23.6% और Claude 3.5 Sonnet के 33.4% से अधिक है
इसे स्थानीय रूप से कैसे चलाएँ
Ollama के साथ सबसे तेज़ शुरुआत:
Qwen2.5-7B को इंस्टॉल और शुरू करें: ollama pull qwen2.5:7b
7B आकार स्थानीय मशीनों के लिए सबसे लोकप्रिय विकल्प है - यह गुणवत्ता, गति और हार्डवेयर आवश्यकताओं को संतुलित करता है।
अन्य टूल: Ollama के अलावा, LM Studio स्थानीय मॉडलों के लिए ChatGPT जैसा इंटरफ़ेस प्रदान करता है। अतिरिक्त विकल्पों में शामिल हैं:
- Jan - सरल डेस्कटॉप UI
- GPT4All - एक-क्लिक मॉडल प्रबंधन
- Msty - हल्का विकल्प
इंस्टॉल होने के बाद ये सभी मॉडलों को सीधे Hugging Face से खींचते हैं।
सीधा Python एकीकरण: कस्टम वर्कफ़्लो के लिए, Hugging Face Transformers के माध्यम से कोई भी मॉडल लोड करें:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
सर्वोत्तम उपयोग के मामले
-
बहुभाषी समर्थन (29+ भाषाएँ): Qwen2.5 29 से अधिक भाषाओं का समर्थन करता है, जिनमें चीनी, अंग्रेजी, फ्रेंच, स्पेनिश, पुर्तगाली, जर्मन, इतालवी, रूसी, जापानी, कोरियाई, वियतनामी, थाई और अरबी शामिल हैं। अंतर्राष्ट्रीय टीमों के लिए आदर्श।
-
एज और मोबाइल परिनियोजन: केवल 3 अरब पैरामीटर वाले मॉडल भी अब अत्यधिक प्रतिस्पर्धी परिणाम देते हैं। 0.5B और 1.5B आकार फोन और एम्बेडेड उपकरणों पर चलते हैं।
-
कोड जनरेशन और फिक्सिंग: Qwen2.5-Coder संस्करण बड़े ओपन मॉडलों से बेहतर प्रदर्शन करते हैं। स्वामित्व वाली क्लाउड सेवाओं के बिना GitHub Copilot जैसी सुविधाओं के लिए उपयोग करें।
-
लंबे-संदर्भ पुनर्प्राप्ति (RAG): 128K संदर्भ वाला 3B मॉडल एक असामान्य पेशकश है - अधिकांश 5B से कम मॉडल 8-32K संदर्भ तक सीमित हैं - जो Qwen 2.5 3B को ऑन-डिवाइस RAG वर्कफ़्लो के लिए एक विश्वसनीय उम्मीदवार बनाता है जहाँ पुनर्प्राप्त संदर्भ लंबा हो सकता है।
-
गोपनीयता-महत्वपूर्ण अनुप्रयोग: Qwen को स्थानीय रूप से चलाना गोपनीयता सुनिश्चित करता है और API लागत समाप्त करता है।
अक्सर पूछे जाने वाले प्रश्न
मुझे अपने लैपटॉप के लिए कौन-सा Qwen 2.5 आकार चुनना चाहिए?
Qwen2.5-7B को लगभग 5.5GB VRAM चाहिए और यह RTX 4060/4070 पर मोटे तौर पर 60-75 टोकन/सेकंड पर चलता है। यदि आपके पास 8GB GPU है, तो 7B मॉडल आदर्श है। 12GB+ के लिए, 14B संस्करण थोड़ी धीमी गति पर उल्लेखनीय बेहतर गुणवत्ता प्रदान करता है।
क्या Qwen 2.5 वास्तव में ओपन सोर्स है?
अधिकांश मॉडल Apache 2.0 के तहत लाइसेंस प्राप्त हैं, जबकि Qwen2.5-3B और Qwen2.5-72B क्रमशः Qwen Research License और Qwen License द्वारा शासित हैं। Apache 2.0 व्यावसायिक उपयोग की अनुमति देता है; अन्य दो लाइसेंस कुछ प्रतिबंधों के साथ अनुसंधान और व्यावसायिक उपयोग की अनुमति देते हैं - व्यावसायिक रूप से परिनियोजित करने से पहले Hugging Face पर लाइसेंस की शर्तें जाँचें।
Qwen 2.5 की Llama 3.1 से तुलना कैसे होती है?
Qwen 2.5 72B कई बेंचमार्कों पर Llama 3.1 405B से बेहतर प्रदर्शन करता है, पाँचवें हिस्से के सक्रिय पैरामीटरों पर। Meta का 405B जब जारी हुआ तब सबसे बड़ा ओपन फ्लैगशिप था, लेकिन Qwen 2.5 के पास कई मानक परीक्षणों पर बेहतर प्रदर्शन दिखाने के प्रमाण हैं।
क्या मैं अपने Mac पर Qwen 2.5 चला सकता हूँ?
हाँ। 18 GB या अधिक एकीकृत मेमोरी वाला कोई भी M-श्रृंखला Mac Qwen2.5-Coder 14B को Q5_K_M या उससे अधिक पर चला सकता है। M4 Pro 24GB Q6_K पर संदर्भ के लिए जगह के साथ मजबूत अनुभव देता है। बेस Qwen2.5 मॉडलों की आवश्यकताएँ समान या कम हैं।
स्रोत और क्रेडिट
मूल स्रोत: Hugging Face & Alibaba Qwen Official