Reupload
पीसी जांच
होम पर वापस जाएं

लोकल एआई · Hugging Face & Alibaba Qwen Official

Qwen 2.5: Alibaba के ओपन LLM की पूर्ण गाइड

Qwen 2.5: Alibaba के ओपन LLM की पूर्ण गाइड

फोटो: Bhautik Patel Unsplash पर

Qwen2.5 Qwen बड़े भाषा मॉडलों की नवीनतम श्रृंखला है, जो 0.5B से 72B पैरामीटर तक 7 आकारों में उपलब्ध है। मॉडलों को 18 ट्रिलियन टोकन पर प्रशिक्षित किया गया है और ये 29+ भाषाओं का समर्थन करते हैं, अधिकांश आकारों के लिए Apache 2.0 लाइसेंसिंग के साथ। Qwen2.5 इन क्षेत्रों में विशेष विशेषज्ञ मॉडलों की बदौलत कोडिंग और गणित में काफी बेहतर क्षमताएँ लाता है।

Qwen 2.5 क्या है?

Qwen2.5 Qwen बड़े भाषा मॉडलों की नवीनतम श्रृंखला है। 18 ट्रिलियन टोकन और पर्यवेक्षित फाइन-ट्यूनिंग तथा बहु-चरणीय रीइन्फोर्समेंट लर्निंग सहित परिष्कृत पोस्ट-ट्रेनिंग तकनीकों पर निर्मित, Qwen2.5 बड़े स्वामित्व वाले सिस्टमों से प्रतिस्पर्धा करने वाले प्रतिस्पर्धी ओपन-वेट मॉडल बनाने की Alibaba की दिशा को दर्शाता है।

Qwen2.5 इन क्षेत्रों में विशेष विशेषज्ञ मॉडलों की बदौलत कोडिंग और गणित में काफी बेहतर क्षमताएँ लाता है। यह निर्देश अनुसरण, लंबे टेक्स्ट निर्माण (8K टोकन से अधिक), संरचित डेटा (जैसे तालिकाएँ) को समझने और संरचित आउटपुट, विशेष रूप से JSON प्रारूप में, उत्पन्न करने में महत्वपूर्ण प्रगति प्रदर्शित करता है।

उपलब्ध आकार और संस्करण

Qwen2.5 7 आकारों में प्री-ट्रेंड और इंस्ट्रक्शन-ट्यून्ड मॉडल प्रदान करता है: 0.5B, 1.5B, 3B, 7B, 14B, 32B और 72B। एक ही रिलीज़ में 100 से अधिक मॉडल उपलब्ध हैं, जिनमें सात पैरामीटर आकारों में बेस और इंस्ट्रक्ट संस्करण, साथ ही विशेष Qwen2.5-Coder और Qwen2.5-Math संस्करण, तथा GGUF, AWQ और GPTQ क्वांटाइज़्ड संस्करण शामिल हैं।

बेस बनाम इंस्ट्रक्शन-ट्यून्ड मॉडल:

  • बेस मॉडल प्री-ट्रेंड हैं और निरंतर फाइन-ट्यूनिंग के लिए उपयुक्त हैं
  • इंस्ट्रक्शन-ट्यून्ड संस्करण चैट और बातचीत के लिए अनुकूलित हैं (अधिकांश उपयोगकर्ताओं के लिए अनुशंसित)

विशेष संस्करण:

  • Qwen2.5-Coder विशेष रूप से कोडिंग अनुप्रयोगों के लिए डिज़ाइन किया गया है
  • Qwen2.5-Math एक Chain-of-Thought + Tool-Integrated Reasoning पाइपलाइन के साथ विशेष गणित-तर्क फाइन-ट्यून प्रदान करता है

लाइसेंसिंग:

  • अधिकांश मॉडल Apache 2.0 के तहत लाइसेंस प्राप्त हैं, जबकि Qwen2.5-3B और Qwen2.5-72B क्रमशः Qwen Research License और Qwen License द्वारा शासित हैं

हार्डवेयर आवश्यकताएँ

0.5B (लैपटॉप/फोन/Pi) से 72B (डुअल-3090 फ्लैगशिप) तक की श्रेणी का अर्थ है कि हर सेटअप के लिए एक Qwen 2.5 संस्करण मौजूद है। यहाँ लोकप्रिय क्वांटाइज़ेशन पर विशिष्ट VRAM आवश्यकताएँ हैं:

मॉडलQ4_K_M (अनुशंसित)FP16 (पूर्ण परिशुद्धता)न्यूनतम GPU
0.5B~400MB~1GBRaspberry Pi 5 / फोन
1.5B~1.5GB~3GB4GB RAM
3B~2GB~6GB8GB RAM
7B~5.5GB~14GBRTX 4060 (8GB)
14B~8.5GB~28GBRTX 4070 (12GB)
32B~19.5GB~64GBRTX 4090 (24GB)
72B~45GB~144GBDual A100 (40GB)

अधिकांश मॉडल 128K (131,072) टोकन की संदर्भ लंबाई का समर्थन करते हैं और 8K टोकन तक उत्पन्न कर सकते हैं, जो व्यापक टेक्स्ट आउटपुट के निर्माण को सक्षम बनाता है।

क्वांटाइज़ेशन सुझाव:

  • Q4_K_M गुणवत्ता बनाम VRAM समझौते के लिए अनुशंसित मध्य-मार्ग है
  • Q8_0 अधिक सटीकता बनाए रखता है लेकिन 2x VRAM की आवश्यकता होती है
  • Q3/Q2 क्वांटाइज़ेशन तंग मेमोरी के लिए आपातकालीन विकल्प हैं

बेंचमार्क की मुख्य बातें

Qwen2.5 मानक मूल्यांकनों में प्रतिस्पर्धी प्रदर्शन दिखाता है:

  • MATH बेंचमार्क पर, Qwen2.5-7B/72B-Instruct के स्कोर 52.9/69.0 से बढ़कर 75.5/83.1 हो गए हैं
  • Qwen2.5-72B MMLU और BBH जैसे सामान्य कार्यों में उत्कृष्ट है, 79.7 और 78.2 स्कोर प्राप्त करते हुए, बड़े आकार के प्रतिस्पर्धियों को पीछे छोड़ता है
  • Qwen2.5-14B और Qwen2.5-32B तुलनीय या बड़े आकार के बेसलाइन मॉडलों से बेहतर प्रदर्शन करते हैं, मॉडल आकार और क्षमता के बीच इष्टतम संतुलन प्राप्त करते हुए

कोडिंग प्रदर्शन:

  • Qwen 2.5-Coder-32B LiveCodeBench पर 37.2% स्कोर करता है, GPT-4o के 29.2% को पीछे छोड़ते हुए
  • 72B मॉडल का SWE-Bench Verified (वास्तविक दुनिया की बग फिक्सिंग) पर 36.5% स्कोर GPT-4o के 23.6% और Claude 3.5 Sonnet के 33.4% से अधिक है

इसे स्थानीय रूप से कैसे चलाएँ

Ollama के साथ सबसे तेज़ शुरुआत:

Qwen2.5-7B को इंस्टॉल और शुरू करें: ollama pull qwen2.5:7b

7B आकार स्थानीय मशीनों के लिए सबसे लोकप्रिय विकल्प है - यह गुणवत्ता, गति और हार्डवेयर आवश्यकताओं को संतुलित करता है।

अन्य टूल: Ollama के अलावा, LM Studio स्थानीय मॉडलों के लिए ChatGPT जैसा इंटरफ़ेस प्रदान करता है। अतिरिक्त विकल्पों में शामिल हैं:

  • Jan - सरल डेस्कटॉप UI
  • GPT4All - एक-क्लिक मॉडल प्रबंधन
  • Msty - हल्का विकल्प

इंस्टॉल होने के बाद ये सभी मॉडलों को सीधे Hugging Face से खींचते हैं।

सीधा Python एकीकरण: कस्टम वर्कफ़्लो के लिए, Hugging Face Transformers के माध्यम से कोई भी मॉडल लोड करें:

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")

सर्वोत्तम उपयोग के मामले

  • बहुभाषी समर्थन (29+ भाषाएँ): Qwen2.5 29 से अधिक भाषाओं का समर्थन करता है, जिनमें चीनी, अंग्रेजी, फ्रेंच, स्पेनिश, पुर्तगाली, जर्मन, इतालवी, रूसी, जापानी, कोरियाई, वियतनामी, थाई और अरबी शामिल हैं। अंतर्राष्ट्रीय टीमों के लिए आदर्श।

  • एज और मोबाइल परिनियोजन: केवल 3 अरब पैरामीटर वाले मॉडल भी अब अत्यधिक प्रतिस्पर्धी परिणाम देते हैं। 0.5B और 1.5B आकार फोन और एम्बेडेड उपकरणों पर चलते हैं।

  • कोड जनरेशन और फिक्सिंग: Qwen2.5-Coder संस्करण बड़े ओपन मॉडलों से बेहतर प्रदर्शन करते हैं। स्वामित्व वाली क्लाउड सेवाओं के बिना GitHub Copilot जैसी सुविधाओं के लिए उपयोग करें।

  • लंबे-संदर्भ पुनर्प्राप्ति (RAG): 128K संदर्भ वाला 3B मॉडल एक असामान्य पेशकश है - अधिकांश 5B से कम मॉडल 8-32K संदर्भ तक सीमित हैं - जो Qwen 2.5 3B को ऑन-डिवाइस RAG वर्कफ़्लो के लिए एक विश्वसनीय उम्मीदवार बनाता है जहाँ पुनर्प्राप्त संदर्भ लंबा हो सकता है।

  • गोपनीयता-महत्वपूर्ण अनुप्रयोग: Qwen को स्थानीय रूप से चलाना गोपनीयता सुनिश्चित करता है और API लागत समाप्त करता है।

अक्सर पूछे जाने वाले प्रश्न

मुझे अपने लैपटॉप के लिए कौन-सा Qwen 2.5 आकार चुनना चाहिए?

Qwen2.5-7B को लगभग 5.5GB VRAM चाहिए और यह RTX 4060/4070 पर मोटे तौर पर 60-75 टोकन/सेकंड पर चलता है। यदि आपके पास 8GB GPU है, तो 7B मॉडल आदर्श है। 12GB+ के लिए, 14B संस्करण थोड़ी धीमी गति पर उल्लेखनीय बेहतर गुणवत्ता प्रदान करता है।

क्या Qwen 2.5 वास्तव में ओपन सोर्स है?

अधिकांश मॉडल Apache 2.0 के तहत लाइसेंस प्राप्त हैं, जबकि Qwen2.5-3B और Qwen2.5-72B क्रमशः Qwen Research License और Qwen License द्वारा शासित हैं। Apache 2.0 व्यावसायिक उपयोग की अनुमति देता है; अन्य दो लाइसेंस कुछ प्रतिबंधों के साथ अनुसंधान और व्यावसायिक उपयोग की अनुमति देते हैं - व्यावसायिक रूप से परिनियोजित करने से पहले Hugging Face पर लाइसेंस की शर्तें जाँचें।

Qwen 2.5 की Llama 3.1 से तुलना कैसे होती है?

Qwen 2.5 72B कई बेंचमार्कों पर Llama 3.1 405B से बेहतर प्रदर्शन करता है, पाँचवें हिस्से के सक्रिय पैरामीटरों पर। Meta का 405B जब जारी हुआ तब सबसे बड़ा ओपन फ्लैगशिप था, लेकिन Qwen 2.5 के पास कई मानक परीक्षणों पर बेहतर प्रदर्शन दिखाने के प्रमाण हैं।

क्या मैं अपने Mac पर Qwen 2.5 चला सकता हूँ?

हाँ। 18 GB या अधिक एकीकृत मेमोरी वाला कोई भी M-श्रृंखला Mac Qwen2.5-Coder 14B को Q5_K_M या उससे अधिक पर चला सकता है। M4 Pro 24GB Q6_K पर संदर्भ के लिए जगह के साथ मजबूत अनुभव देता है। बेस Qwen2.5 मॉडलों की आवश्यकताएँ समान या कम हैं।

जानना चाहते हैं कि आपका कंप्यूटर लोकल एआई चला सकता है या नहीं?

स्रोत और क्रेडिट

मूल स्रोत: Hugging Face & Alibaba Qwen Official