लोकल एआई · Official model documentation and technical reports (Hugging Face, Meta, Mistral AI, Alibaba, Microsoft, Google)
5 ओपन-वेट LLM की तुलना: Llama, Mistral, Qwen, Phi, Gemma
फोटो: Umberto Unsplash पर
पाँच प्रमुख ओपन-वेट भाषा मॉडल परिवारों (Llama 3.2, Mistral/Mixtral, Qwen 2.5, Phi-4 और Gemma 2) की विस्तृत तुलना, जिसमें पैरामीटर आकार, संदर्भ लंबाई, लाइसेंसिंग और मुख्य शक्तियाँ शामिल हैं। यह गाइड डेवलपर्स को उनकी हार्डवेयर सीमाओं और उपयोग के मामलों के लिए सर्वश्रेष्ठ मॉडल चुनने में मदद करती है।
इन 5 मॉडल परिवारों की तुलना क्यों करें?
ओपन-वेट LLM परिदृश्य प्रमुख AI प्रयोगशालाओं से व्यवहार्य विकल्पों के साथ विस्फोटक रूप से बढ़ा है। प्रत्येक परिवार पैरामीटर गणना, संदर्भ विंडो, इन्फरेंस गति और तर्क क्षमता के बीच अलग-अलग समझौते करता है। चाहे आप एज उपकरणों पर परिनियोजित कर रहे हों, कोडिंग सहायक बना रहे हों, या बहुभाषी दस्तावेजों को संसाधित कर रहे हों, ये पाँच परिवार वर्तमान पैरेटो सीमा का प्रतिनिधित्व करते हैं - और ये सभी उपभोक्ता हार्डवेयर पर स्थानीय रूप से चल सकते हैं। डाउनलोड और परिनियोजन से पहले उनके विनिर्देशों को समझना आवश्यक है।
तुलना तालिका
| मॉडल परिवार | पैरामीटर आकार | अधिकतम संदर्भ | लाइसेंस | प्रकाशक | विशिष्ट शक्ति |
|---|---|---|---|---|---|
| Llama 3.2 | 1B, 3B, 11B*, 90B* | 128K | Llama Community | Meta | ऑन-डिवाइस परिनियोजन (1B/3B) |
| Mistral/Mixtral | 7B, 8x7B (कुल 46.7B) | 32K | Apache 2.0 | Mistral AI | कोड जनरेशन और इन्फरेंस गति |
| Qwen 2.5 | 0.5B - 72B | 128K (1M Turbo) | Apache 2.0 | Alibaba | लंबे-संदर्भ प्रबंधन, बहुभाषी |
| Phi-4 | 3.8B, 14B, 5.6B* | 16K, 128K* | MIT | Microsoft | प्रति पैरामीटर तर्क गुणवत्ता |
| Gemma 2 | 2B, 9B, 27B | 8K | Gemma Terms | कुशल सघन मॉडल |
*विज़न/मल्टीमॉडल संस्करण। Llama 3.2 11B/90B छवि समझ जोड़ते हैं; Phi-4 multimodal 128K संदर्भ जोड़ता है; Gemma Gemma 4 में 256K की योजना बना रहा है।
संक्षेप में Llama 3.2
Llama 3.2 में छोटे और मध्यम आकार के विज़न LLM (11B और 90B), और हल्के, केवल-टेक्स्ट मॉडल (1B और 3B) शामिल हैं। 1B और 3B मॉडल 128K टोकन की संदर्भ लंबाई का समर्थन करते हैं और एज पर स्थानीय रूप से चलने वाले सारांशीकरण, निर्देश अनुसरण और पुनर्लेखन जैसे ऑन-डिवाइस उपयोग के मामलों के लिए अपनी श्रेणी में अत्याधुनिक हैं।
मुख्य विनिर्देश: 9 ट्रिलियन टोकन तक पर प्रशिक्षित और 128k टोकन की लंबी संदर्भ लंबाई का समर्थन करते हैं। Llama 3.2 का उपयोग Llama 3.2 Community License (एक कस्टम, व्यावसायिक लाइसेंस समझौता) द्वारा शासित है, जिसमें मासिक सक्रिय उपयोगकर्ता 700 मिलियन से अधिक होने पर Meta से लाइसेंस अनुरोध करने की आवश्यकता है।
इनके लिए सर्वोत्तम: मोबाइल परिनियोजन, सारांशीकरण, एज AI, संसाधन-सीमित उपकरणों पर निर्देश-अनुसरण कार्य।
संक्षेप में Mistral / Mixtral
Mistral एक 7B पैरामीटर भाषा मॉडल है, जो बड़े मॉडलों की स्केलिंग लागत को प्रदर्शन और कुशल इन्फरेंस के साथ संतुलित करने पर केंद्रित है। इसके विपरीत, Mixtral में कुल 46.7B पैरामीटर हैं लेकिन प्रति टोकन केवल 12.9B पैरामीटर का उपयोग करता है, इनपुट को संसाधित करता है और आउटपुट उत्पन्न करता है 12.9B मॉडल की समान गति पर और समान लागत पर।
मुख्य विनिर्देश: Mixtral 32k टोकन के संदर्भ को सहजता से संभालता है। दोनों Apache 2.0 के तहत लाइसेंस प्राप्त हैं। Mixtral कोड जनरेशन में मजबूत प्रदर्शन दिखाता है।
इनके लिए सर्वोत्तम: कोड जनरेशन, मामूली GPU पर कुशल इन्फरेंस, प्रति-टोकन लागत अनुकूलन, बहुभाषी वर्कफ़्लो।
संक्षेप में Qwen 2.5
Qwen 2.5 रिलीज़ में 0.5B से 72B तक के आकारों वाले सात ओपन-सोर्स मॉडल शामिल हैं। अधिकांश मॉडल 128K (131,072) टोकन की संदर्भ लंबाई का समर्थन करते हैं और 8K टोकन तक उत्पन्न कर सकते हैं।
मुख्य विनिर्देश: 18 ट्रिलियन टोकन पर प्रशिक्षण और परिष्कृत पोस्ट-ट्रेनिंग तकनीकें, जिनमें पर्यवेक्षित फाइन-ट्यूनिंग और बहु-चरणीय रीइन्फोर्समेंट लर्निंग शामिल हैं। Qwen मॉडल Apache License 2.0 के तहत जारी किए गए हैं, एक अनुमतिपूर्ण ओपन सोर्स लाइसेंस जो व्यावसायिक उपयोग सहित मुफ्त उपयोग, संशोधन और वितरण की अनुमति देता है, जिसमें कॉपीराइट सूचनाओं और अस्वीकरणों को संरक्षित रखना आवश्यक है। विस्तारित संदर्भ उपलब्ध: Qwen2.5-1M लंबे-संदर्भ संस्करण है जो 1M टोकन तक की संदर्भ लंबाई का समर्थन करता है।
इनके लिए सर्वोत्तम: बहुभाषी अनुप्रयोग, लंबे-संदर्भ दस्तावेज़ प्रसंस्करण, पैमाने पर निर्देश-अनुसरण (72B संस्करण), सघन तर्क।
संक्षेप में Phi-4
Microsoft Phi-4 एक 14 अरब पैरामीटर वाला केवल-डिकोडर Transformer मॉडल है, जिसे सीमित कंप्यूट और मेमोरी वाले वातावरणों में परिनियोजन को सक्षम करते हुए कुशलता से उन्नत तर्क क्षमताएँ प्रदान करने के लिए विकसित किया गया है। Phi-4 16,000-टोकन संदर्भ लंबाई का समर्थन करता है, जो इसे व्यापक लंबे-रूप सामग्री को संसाधित और उत्पन्न करने की अनुमति देता है।
मुख्य विनिर्देश: लगभग 10 ट्रिलियन (10T) टोकन पर प्रशिक्षित। Phi-4 एक अनुमतिपूर्ण MIT लाइसेंस के साथ आता है, जो इसे व्यावसायिक अनुप्रयोगों के लिए उपयोग करने की अनुमति देता है। एक मुख्य नवाचार इसके उच्च-गुणवत्ता सिंथेटिक डेटा के रणनीतिक उपयोग में निहित है, जो इसके प्रशिक्षण कॉर्पस का एक महत्वपूर्ण हिस्सा है।
इनके लिए सर्वोत्तम: गणितीय तर्क, जटिल तर्क समस्याएँ, वैज्ञानिक प्रश्न-उत्तर, संसाधन-सीमित व्यावसायिक परिनियोजन।
संक्षेप में Gemma 2
Gemma 2 दो आकारों में आता है, 9 अरब और 27 अरब पैरामीटर, बेस (प्री-ट्रेंड) और इंस्ट्रक्शन-ट्यून्ड संस्करणों के साथ। Gemma 2 मॉडलों को उनके पहले संस्करण की तुलना में लगभग 2x अधिक डेटा पर प्रशिक्षित किया गया था, 27B संस्करण के लिए कुल 13 ट्रिलियन टोकन और 9B संस्करण के लिए 8 ट्रिलियन टोकन वेब डेटा (मुख्यतः अंग्रेजी), कोड और गणित।
मुख्य विनिर्देश: 8192 टोकन की संदर्भ लंबाई, Rotary Position Embeddings (RoPE) का उपयोग। Gemma 2 एक अनुमतिपूर्ण लाइसेंस के साथ आता है जो पुनर्वितरण, फाइन-ट्यूनिंग, व्यावसायिक उपयोग और व्युत्पन्न कार्यों की अनुमति देता है (कस्टम Gemma Terms of Use)। हर दूसरी लेयर पर स्लाइडिंग विंडो अटेंशन लागू किया जाता है (स्थानीय - 4096 टोकन), जबकि बीच की लेयरें अभी भी पूर्ण द्विघात वैश्विक अटेंशन (8192 टोकन) का उपयोग करती हैं, जो लंबे संदर्भ स्थितियों में गुणवत्ता बढ़ाने और आंशिक रूप से स्लाइडिंग अटेंशन के लाभों का लाभ उठाने का एक तरीका है।
इनके लिए सर्वोत्तम: संतुलित सामान्य-प्रयोजन उपयोग, ऑन-डिवाइस परिनियोजन (2B), TPU/GPU पर कुशल इन्फरेंस, शिक्षा और अनुसंधान।
आपको कौन-सा मॉडल चुनना चाहिए?
मामूली हार्डवेयर के लिए (4-8GB VRAM या कम):
- Llama 3.2 1B यदि आपको एज/मोबाइल परिनियोजन चाहिए
- समान फुटप्रिंट में बेहतर तर्क के लिए Phi-4-mini (3.8B)
- हल्के इंस्ट्रक्शन-ट्यून्ड चैट के लिए Gemma 2 2B
मिड-रेंज हार्डवेयर के लिए (12-24GB VRAM):
- लंबे-संदर्भ कार्यों के लिए Qwen 2.5 7B या Llama 3.2 3B
- गणितीय तर्क और कोडिंग के लिए Phi-4 14B
- सामान्य-प्रयोजन, सर्वांगीण प्रदर्शन के लिए Gemma 2 9B
गंभीर कोडिंग कार्यों के लिए:
- कुशल इन्फरेंस के साथ सर्वश्रेष्ठ कोड जनरेशन के लिए Mixtral 8x7B
- जटिल कोड जनरेशन और तर्क के लिए Qwen 2.5 32B-72B
- गणित-भारी एल्गोरिथम डिज़ाइन के लिए Phi-4 14B
बहुभाषी या क्रॉस-लैंग्वेज कार्य के लिए:
- Qwen 2.5 (स्पष्ट रूप से 29+ भाषाओं पर प्रशिक्षित)
- Mistral 7B/Mixtral (फ्रेंच, जर्मन, स्पेनिश, इतालवी, अंग्रेजी का समर्थन करता है)
- Gemma 2 से बचें जब तक अंग्रेजी-प्राथमिक स्वीकार्य न हो
अधिकतम संदर्भ लंबाई के लिए:
- Qwen 2.5-Turbo या Qwen 2.5-1M (1M टोकन तक, 128K पर उत्पादन-तैयार)
- Qwen 2.5 128K संस्करण (7B-72B)
- Phi-4 संस्करण 128K तक (मल्टीमॉडल संस्करण)
लाइसेंसिंग स्पष्टता के साथ व्यावसायिक परिनियोजन के लिए:
- Phi-4 (MIT - एट्रिब्यूशन से परे शून्य प्रतिबंध)
- Mistral/Mixtral (Apache 2.0 - अनुमतिपूर्ण, कोई उपयोगकर्ता सीमा नहीं)
- Qwen 2.5 (Apache 2.0 - Mistral के समान)
- बचें: Llama (700M MAU सीमा), Gemma (फ्लो-डाउन दायित्वों वाली कस्टम Terms)
शुद्ध दक्षता के लिए (इन्फरेंस गति + कम VRAM):
- Mistral 7B (स्लाइडिंग विंडो अटेंशन)
- Mixtral 8x7B (विरल MoE - प्रति टोकन 13B सक्रिय)
- Phi-4-mini 3.8B (सघन, उच्च-गुणवत्ता डेटा)
अक्सर पूछे जाने वाले प्रश्न
क्या मैं इन मॉडलों का बिना प्रतिबंध के व्यावसायिक उपयोग कर सकता हूँ?
समान रूप से नहीं। Phi-4 एक अनुमतिपूर्ण MIT लाइसेंस के साथ आता है, जो इसे व्यावसायिक अनुप्रयोगों के लिए उपयोग करने की अनुमति देता है। Mistral, Mixtral और Qwen 2.5 सभी Apache 2.0 (कोई प्रतिबंध नहीं) का उपयोग करते हैं। Llama 3.2 व्यावसायिक उपयोग की अनुमति देता है लेकिन यदि आपका उत्पाद 700 मिलियन मासिक सक्रिय उपयोगकर्ताओं से अधिक हो जाता है तो Meta से एक अलग लाइसेंस आवश्यक है। Gemma 2 व्यावसायिक परिनियोजन की अनुमति देता है लेकिन कस्टम Gemma Terms of Use के तहत, न कि मानक ओपन-सोर्स लाइसेंस के तहत।
RTX 4090 या RTX 4070 जैसे उपभोक्ता GPU पर कौन-सा मॉडल चलता है?
Phi-4 Multimodal 5.6B पैरामीटर और 128K टोकन संदर्भ लंबाई के साथ ऑन-डिवाइस निष्पादन और कम-लेटेंसी इन्फरेंस दोनों के लिए अनुकूलित है। Qwen 2.5 7B-14B, Mistral 7B, Llama 3.2 3B और Gemma 2 9B सभी 12-24GB VRAM में कुशलता से फिट होने के लिए क्वांटाइज़ होते हैं। सर्वोत्तम संगतता के लिए, 4-बिट या 8-बिट क्वांटाइज़ेशन (GGUF, AWQ या bitsandbytes प्रारूप) का उपयोग करें।
वास्तविक दस्तावेज़ कार्य के लिए संदर्भ लंबाइयों की तुलना वास्तव में कैसे होती है?
अधिकांश Qwen 2.5 मॉडल 128K (131,072) टोकन की संदर्भ लंबाई का समर्थन करते हैं और 8K टोकन तक उत्पन्न कर सकते हैं, जो Llama 3.2 से मेल खाता है। Mistral और Mixtral 32K तक सीमित हैं। Gemma 2 8K तक सीमित है, जो इसे पूर्ण-दस्तावेज़ प्रसंस्करण के लिए अनुपयुक्त बनाता है; Phi-4 का 16K बेहतर है लेकिन फिर भी मामूली है। उत्पादन लंबे-संदर्भ उपयोग के लिए, Qwen 2.5 स्पष्ट विजेता है।
क्या सिंथेटिक प्रशिक्षण डेटा (Phi-4) विविध इंटरनेट डेटा से बेहतर है?
यह कार्य पर निर्भर करता है। Phi-4 का उच्च-गुणवत्ता सिंथेटिक डेटा का रणनीतिक उपयोग, जो मल्टी-एजेंट प्रॉम्प्टिंग, इंस्ट्रक्शन रिवर्सल और स्व-संशोधन वर्कफ़्लो जैसी तकनीकों का उपयोग करके उत्पन्न किया गया है, इसे मजबूत तर्क और समस्या-समाधान क्षमताएँ प्राप्त करने में सक्षम बनाता है, जो अक्सर बड़े पैरामीटर गणना वाले मॉडलों को पीछे छोड़ देता है। यह गणित, तर्क और कोड के लिए असाधारण रूप से अच्छा काम करता है - खुले-अंत रचनात्मक या तथ्यात्मक कार्यों के लिए कम, जहाँ Qwen 2.5 या Llama का व्यापक प्रशिक्षण चमकता है।