Reupload
पीसी जांच
होम पर वापस जाएं

लोकल एआई · Mistral AI, Hugging Face, ArXiv

Mistral और Mixtral: ओपन-वेट LLM चलाएँ

Mistral और Mixtral: ओपन-वेट LLM चलाएँ

फोटो: Sandip Kalal Unsplash पर

Mistral AI ने दिसंबर 2023 में अपना पहला ओपन MoE मॉडल जारी किया, जिससे कुशल भाषा मॉडलों की प्रतिष्ठा बनी जो अपने पैरामीटर गणना से बेहतर प्रदर्शन करते हैं। Mixtral 8x7B में कुल 46.7B पैरामीटर हैं लेकिन यह उसके एक-तिहाई आकार के मॉडलों की समान गति और लागत पर इन्फरेंस करता है, और नए संस्करण Apache 2.0 लाइसेंस के तहत उपलब्ध हैं, जो उपभोक्ता हार्डवेयर पर निजी, अनुकूलन योग्य AI परिनियोजन को सक्षम बनाते हैं।

Mistral / Mixtral क्या है?

Mistral Large 3 दुनिया के सर्वश्रेष्ठ अनुमतिपूर्ण ओपन-वेट मॉडलों में से एक है और प्रसिद्ध Mixtral श्रृंखला के बाद Mistral का पहला मिश्रण-विशेषज्ञ (mixture-of-experts) मॉडल है। Mistral परिवार में सघन मॉडल (7B, 24B, 128B) और विरल Mixture-of-Experts संस्करण दोनों शामिल हैं। Mixtral 8x7B प्रत्येक 7B पैरामीटर के 8 विशेषज्ञ नेटवर्क का उपयोग करता है, प्रति टोकन केवल 2 विशेषज्ञ सक्रिय होते हैं, जिसका अर्थ है कि आप ~13B सक्रिय पैरामीटर प्राप्त करते हैं जबकि 47B कुल पैरामीटर का लाभ उठाते हैं।

Mixtral मॉडल परिवार एक विरल Mixture-of-Experts (SMoE) आर्किटेक्चर का उपयोग करता है जहाँ एक राउटर प्रत्येक टोकन को संसाधित करने के लिए विशेषज्ञ नेटवर्क के एक उपसमूह का चयन करता है। यह डिज़ाइन असाधारण दक्षता प्रदान करता है: Mixtral 8x7B 70B सघन मॉडल के करीब गुणवत्ता प्रदान करता है लेकिन 13B मॉडल की इन्फरेंस लागत पर।

उपलब्ध आकार और संस्करण

ओपन-वेट Mistral / Mixtral लाइनअप में शामिल हैं:

  • Mistral 7B - 7 अरब पैरामीटर वाला एक प्री-ट्रेंड जनरेटिव टेक्स्ट मॉडल जो बेस और इंस्ट्रक्ट संस्करणों में उपलब्ध है
  • Mixtral 8x7B - कुल 46.7B पैरामीटर जो उसके एक-तिहाई आकार के मॉडलों की समान गति और लागत पर इन्फरेंस करता है, 32k टोकन संदर्भ लंबाई के साथ
  • Mixtral 8x22B - 141B कुल पैरामीटरों में से 39B सक्रिय पैरामीटरों वाला विरल mixture-of-experts, जिसमें 64K टोकन संदर्भ विंडो है
  • Mistral Small 3.1 - अत्याधुनिक विज़न समझ और 128k टोकन संदर्भ क्षमताओं के साथ 24 अरब पैरामीटर
  • Mistral Large 3 - 41B सक्रिय पैरामीटरों और 675B कुल पैरामीटरों वाला अत्याधुनिक सामान्य-प्रयोजन मल्टीमॉडल ग्रैनुलर Mixture-of-Experts मॉडल

सभी ओपन-वेट संस्करण Apache 2.0 लाइसेंस के तहत जारी किए गए हैं, जो अप्रतिबंधित अनुसंधान और व्यावसायिक उपयोग को सक्षम बनाते हैं।

हार्डवेयर आवश्यकताएँ

VRAM की आवश्यकताएँ मॉडल आकार और क्वांटाइज़ेशन के अनुसार काफी भिन्न होती हैं:

  • Mistral 7B: Q4 या Q5 क्वांटाइज़ेशन के साथ 6-8GB VRAM
  • Mixtral 8x7B: Q4 क्वांटाइज़ेशन के लिए 24GB VRAM (आंशिक ऑफलोड के साथ ~28.4 GB वेट)
  • Mixtral 8x22B: Q4 के लिए 48GB+ VRAM (~85.9 GB वेट, ~97 GB कुल)

MoE मॉडलों को सभी विशेषज्ञों को VRAM में रखना होता है भले ही प्रति टोकन केवल कुछ ही सक्रिय हों। 4-बिट क्वांटाइज़ेशन में Mixtral 8x7B को मोटे तौर पर 28GB चाहिए और यह एकल NVIDIA RTX 5090 32GB पर फिट हो जाता है।

सिस्टम-स्तरीय विशिष्टताओं के लिए: न्यूनतम 16 GB RAM (32 GB अनुशंसित), कोई भी आधुनिक 8-कोर CPU, और मॉडल फ़ाइलों के लिए 100-500 GB खाली स्थान वाला NVMe SSD। Mac (Apple Silicon) एकीकृत मेमोरी और MLX रनटाइम के कारण उत्कृष्ट है, Windows NVIDIA + CUDA के साथ सर्वोत्तम है, और Linux AMD ROCm समर्थन सहित सबसे व्यापक GPU लचीलापन प्रदान करता है।

बेंचमार्क की मुख्य बातें

Mixtral 8x7B ने बारह बेंचमार्कों में से नौ पर Llama 2 70B से बेहतर प्रदर्शन किया। अधिक विशेष रूप से, Mixtral फ्रेंच, जर्मन, स्पेनिश और इतालवी में Llama 2 70B से काफी बेहतर प्रदर्शन करता है।

Mixtral 8x7B MMLU पर ~70% प्राप्त करता है, जो Mistral 7B से अर्थपूर्ण रूप से बेहतर है। Mixtral 32k टोकन के संदर्भ को संभाल सकता है, कोड जनरेशन में मजबूत विशेषताएँ दिखाता है, और 46.7 अरब कुल पैरामीटरों के साथ लेकिन प्रति टोकन केवल 12.9 अरब का उपयोग करते हुए, गति और लागत दक्षता दोनों बनाए रखता है।

Mistral 8x7B हाल के बेंचमार्कों पर 43.1 पर रैंक करता है, Mistral Large 3 (45.7) और Ministral 3 14B Reasoning (47.3) से पीछे। अत्याधुनिक क्षमताओं के लिए, Mistral Large 3 सामान्य प्रॉम्प्टों पर सर्वश्रेष्ठ इंस्ट्रक्शन-ट्यून्ड ओपन-वेट मॉडलों के साथ समानता प्राप्त करता है, साथ ही छवि समझ और बहुभाषी बातचीत पर श्रेणी-सर्वश्रेष्ठ प्रदर्शन प्रदर्शित करता है, और LMArena लीडरबोर्ड पर OSS गैर-तर्क मॉडल श्रेणी में #2 पर शुरुआत करता है।

इसे स्थानीय रूप से कैसे चलाएँ

सबसे सरल तरीका Ollama है, एक कमांड-लाइन-प्रथम रनटाइम जिसमें हल्का बैकग्राउंड सर्वर और OpenAI-संगत API है। ollama.com से इंस्टॉल करें, फिर चलाएँ:

ollama run mixtral:8x7b

8x22B संस्करण के लिए उपयोग करें: ollama run mixtral:8x22b। Ollama की लाइब्रेरी में Llama, Qwen, DeepSeek, Mistral, Gemma और OpenAI की ओपन-वेट gpt-oss श्रृंखला तक फैले 200+ तैयार-चलाने योग्य मॉडल सूचीबद्ध हैं, प्रत्येक सही प्रॉम्प्ट टेम्पलेट के साथ पूर्व-कॉन्फ़िगर।

वैकल्पिक टूल भी Mistral / Mixtral मॉडलों का समर्थन करते हैं:

  • LM Studio - उन लोगों के लिए लक्षित पॉलिश्ड डेस्कटॉप GUI जो कमांड टाइप करने के बजाय ब्राउज़ और क्लिक करना पसंद करते हैं, और यह एक स्थानीय API सर्वर भी चलाता है
  • Jan - सबसे लोकप्रिय और सर्वाधिक आकर्षक स्थानीय LLM एप्लिकेशनों में से एक, ChatGPT का गोपनीयता-प्रथम विकल्प
  • GPT4All - तीनों में सबसे शुरुआती-अनुकूल, एक क्यूरेटेड, छोटी मॉडल सूची और सरल एक-क्लिक इंस्टॉलेशन अनुभव के साथ

Ollama llama.cpp पर निर्मित है, जो बुद्धिमान मेमोरी प्रबंधन और NVIDIA (CUDA), Apple Silicon (Metal) और AMD (ROCm) GPU के लिए कुशल GPU त्वरण के साथ उत्कृष्ट टोकन-प्रति-सेकंड थ्रूपुट प्रदान करता है।

सर्वोत्तम उपयोग के मामले

Mixtral 8x7B टेक्स्ट सारांशीकरण, प्रश्न और उत्तर, टेक्स्ट वर्गीकरण, टेक्स्ट पूर्णता और कोड जनरेशन के लिए आदर्श है। Mistral 7B टेक्स्ट सारांशीकरण, वर्गीकरण, टेक्स्ट पूर्णता और कोड पूर्णता का समर्थन करता है।

कोड और तकनीकी कार्य: Mistral 7B कोड कार्यों पर CodeLlama 7B के प्रदर्शन के करीब पहुँचता है जबकि अंग्रेजी भाषा के कार्यों में अत्यधिक सक्षम रहता है। Mixtral 8x22B 141B में से केवल 39B सक्रिय पैरामीटरों का उपयोग करता है और बेजोड़ लागत दक्षता प्रदान करता है, मजबूत गणित और कोडिंग क्षमताओं और मूल फंक्शन कॉलिंग के साथ।

दस्तावेज़ प्रसंस्करण और RAG: Mixtral 8x22B की 64K टोकन संदर्भ विंडो बड़े दस्तावेजों से सटीक जानकारी स्मरण की अनुमति देती है, जो इसे रिट्रीवल-ऑगमेंटेड जनरेशन और लंबे-दस्तावेज़ सारांशीकरण के लिए उत्कृष्ट बनाती है।

बहुभाषी वर्कफ़्लो: Mixtral 8x22B में मूल बहुभाषी क्षमताएँ हैं और यह फ्रेंच, जर्मन, स्पेनिश और इतालवी में HellaSwag, Arc Challenge और MMLU बेंचमार्कों पर LLaMA 2 70B से कहीं बेहतर प्रदर्शन करता है।

उत्पादन इन्फरेंस: Mixtral 8x7B उन उत्पादन वातावरणों के लिए उपयुक्त है जिनमें अनुकूलन या फाइन-ट्यूनिंग के लिए ओपन-वेट मॉडलों की आवश्यकता होती है जब कम्प्यूटेशनल संसाधन या लेटेंसी सीमित हों।

अक्सर पूछे जाने वाले प्रश्न

क्या मैं अपने गेमिंग PC पर Mixtral 8x7B चला सकता हूँ?

हाँ, कुछ शर्तों के साथ। 4-बिट क्वांटाइज़ेशन में Mixtral 8x7B को मोटे तौर पर 28GB चाहिए और यह एकल NVIDIA RTX 5090 32GB पर फिट हो जाता है। RTX 3090 (24GB) जैसे पुराने कार्डों के लिए लेयर ऑफलोडिंग तकनीकों की आवश्यकता होती है। यदि आपके पास 8GB है तो Mistral 7B से शुरू करें; यह ~4.4 GB में क्वांटाइज़ हो जाता है।

कौन तेज़ है: सघन Mistral 7B या विरल Mixtral 8x7B?

Mixtral 8x7B 70B सघन मॉडल के करीब गुणवत्ता प्रदान करता है लेकिन 13B मॉडल की इन्फरेंस लागत पर क्योंकि प्रति टोकन 8 में से केवल 2 विशेषज्ञ सक्रिय होते हैं। Mistral 7B छोटा है और तेज़ी से लोड होता है, लेकिन Mixtral अपनी विरल आर्किटेक्चर के कारण तुलनीय गति पर बेहतर गुणवत्ता प्रदान करता है।

क्या Mistral मॉडल व्यावसायिक रूप से उपयोग करने के लिए सुरक्षित हैं?

हाँ। बेस और इंस्ट्रक्शन फाइन-ट्यून्ड दोनों संस्करण Apache 2.0 लाइसेंस के तहत जारी किए गए हैं, जो उद्यम और डेवलपर समुदायों में आगे के अनुकूलन के लिए एक मजबूत आधार प्रदान करते हैं। अनुसंधान या उत्पादन उपयोग पर कोई लाइसेंसिंग प्रतिबंध लागू नहीं होते।

Mixtral 8x22B की Mistral Large 3 से तुलना कैसे होती है?

Mixtral 8x22B मार्च 2025 तक सेवानिवृत्त हो गया है, नए एकीकरणों के लिए Mistral Small 4 की सिफारिश की जाती है। Mistral Large 3 41B सक्रिय पैरामीटरों और 675B कुल पैरामीटरों वाला एक अत्याधुनिक सामान्य-प्रयोजन मल्टीमॉडल mixture-of-experts मॉडल है, जो बेहतर प्रदर्शन प्रदान करता है लेकिन 48GB+ VRAM की आवश्यकता होती है। उपभोक्ता हार्डवेयर पर स्थानीय परिनियोजन के लिए, Mixtral 8x7B या Mistral Small 3.1 व्यावहारिक रूप से सर्वोत्तम विकल्प बने हुए हैं।

जानना चाहते हैं कि आपका कंप्यूटर लोकल एआई चला सकता है या नहीं?

स्रोत और क्रेडिट

मूल स्रोत: Mistral AI, Hugging Face, ArXiv