लोकल एआई · Meta Llama Official Blog & Hugging Face Model Cards
Llama 3.2: ओपन-वेट विज़न और हल्के मॉडल
फोटो: Milad Fakurian Unsplash पर
Llama 3.2 मॉडलों का एक समूह है जिसमें हल्के, केवल-टेक्स्ट 1B और 3B पैरामीटर वाले मॉडल तथा 11B और 90B पैरामीटर वाले विज़न-लैंग्वेज मॉडल शामिल हैं। ये एज-डिवाइस के लिए उपयुक्त केवल-टेक्स्ट मॉडलों से लेकर जटिल तर्क कार्यों में सक्षम मल्टीमॉडल संस्करणों तक फैले हुए हैं। स्थानीय परिनियोजन और क्लाउड इन्फरेंस दोनों के लिए अनुकूलित, Llama 3.2 डिवाइस स्तरों पर AI के लोकतंत्रीकरण की दिशा में Meta का प्रयास दर्शाता है।
Llama 3.2 क्या है?
Llama 3.2 एक अभूतपूर्व भाषा मॉडल परिवार है जिसमें बेहतर क्षमताएँ, व्यापक उपयोगिता और मल्टीमॉडल छवि समर्थन शामिल हैं। इस रिलीज़ में छोटे और मध्यम आकार के विज़न LLM (11B और 90B), तथा हल्के, केवल-टेक्स्ट मॉडल (1B और 3B) शामिल हैं जो एज और मोबाइल उपकरणों पर फिट होते हैं, दोनों प्री-ट्रेंड और इंस्ट्रक्शन-ट्यून्ड संस्करणों में।
11B और 90B पहले Llama मॉडल हैं जो विज़न कार्यों का समर्थन करते हैं, एक नई मॉडल आर्किटेक्चर के साथ जो छवि एनकोडर प्रतिनिधित्वों को भाषा मॉडल में एकीकृत करती है। 1B और 3B मॉडल पहले दिन से Qualcomm और MediaTek हार्डवेयर पर सक्षम हैं और Arm प्रोसेसर के लिए अनुकूलित हैं।
उपलब्ध आकार और संस्करण
Llama 3.2 संग्रह विभिन्न आकारों में मॉडल प्रदान करता है, एज उपकरणों के लिए उपयुक्त हल्के केवल-टेक्स्ट 1B और 3B पैरामीटर मॉडलों से लेकर उच्च-रिज़ॉल्यूशन छवियों के लिए मल्टीमॉडल समर्थन सहित जटिल तर्क कार्यों में सक्षम छोटे और मध्यम आकार के 11B और 90B पैरामीटर मॉडलों तक।
केवल-टेक्स्ट मॉडल (प्री-ट्रेंड और इंस्ट्रक्शन-ट्यून्ड):
- Llama 3.2 1B में 1.23B पैरामीटर हैं; 3B में 3.21B पैरामीटर हैं
- दोनों BF16 और क्वांटाइज़्ड संस्करणों (INT4/INT8) में उपलब्ध
- क्वांटाइज़्ड इंस्ट्रक्ट संस्करणों की संदर्भ लंबाई घटाकर 8k कर दी गई है
विज़न-लैंग्वेज मॉडल (मल्टीमॉडल):
- छवि समझ और टेक्स्ट निर्माण के लिए 11B और 90B विज़न संस्करण
- 11B बेस मॉडल 448 के टाइल आकार का समर्थन करता है, जबकि इंस्ट्रक्ट संस्करण और 90B मॉडल 560 के टाइल आकार का उपयोग करते हैं
हार्डवेयर आवश्यकताएँ
इन्फरेंस के लिए (केवल-टेक्स्ट 1B/3B मॉडल):
- 3B मॉडल को FP16 इन्फरेंस के लिए लगभग 7 GB VRAM चाहिए
- INT4 में क्वांटाइज़ करने पर 3B मॉडल को लगभग 1.8 GB VRAM चाहिए, इसलिए यह 24 GB RTX 4090 पर एक छोटे बैच के लिए जगह के साथ फिट हो जाता है
- अनुशंसित: CUDA समर्थन वाला GPU (16GB VRAM या अधिक); RAM: कम से कम 32GB (बड़े मॉडलों के लिए 64GB)
- मॉडल और निर्भरताओं के लिए कम से कम 50GB मुफ्त डिस्क स्थान
विज़न मॉडलों के लिए (11B/90B):
- विज़न मॉडलों को काफी अधिक संसाधनों की आवश्यकता होती है; स्थानीय परिनियोजन के लिए क्वांटाइज़ेशन (INT4/QLoRA) की सिफारिश की जाती है
CPU/सिस्टम:
- ऑपरेटिंग सिस्टम: Linux (पसंदीदा), macOS, या Windows; Python: संस्करण 3.8 या अधिक; CUDA टूलकिट: GPU त्वरण के लिए आवश्यक (11.6 या नया)
बेंचमार्क की मुख्य बातें
चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ MMLU परीक्षण में, Llama 3.2 90B ने 86.0 स्कोर किया, जो Claude 3 Haiku से थोड़ा बेहतर है और GPT-4o-mini के करीब है।
MMLU (5-shot) पर, Llama 3.2 3B ने 63.4 स्कोर किया, जो Gemma 2B IT के 57.8 से बेहतर है। GPQA (0-shot, CoT) पर, Llama 3.2 90B ने 46.7 स्कोर किया, जो Claude 3 Haiku से बेहतर है लेकिन GPT-4o-mini से पीछे है।
IFEval परीक्षण में, Llama 3.2 3B ने प्रभावशाली 77.4 स्कोर किया, Gemma 2B IT (61.9) और Phi-3.5-mini IT (59.2) को पीछे छोड़ते हुए। MGSM बहुभाषी बेंचमार्क पर, Llama 3.2 90B ने 86.9 स्कोर किया, जो GPT-4o-mini के 87.0 के तुलनीय एक ठोस परिणाम है।
इसे स्थानीय रूप से कैसे चलाएँ
Ollama का उपयोग करना (सबसे तेज़ तरीका):
सबसे लोकप्रिय 3B मॉडल के लिए:
ollama run llama3.2:3b
1B मॉडल के लिए (और भी हल्का):
ollama run llama3.2:1b
वैकल्पिक स्थानीय रनर:
- LM Studio - अंतर्निहित मॉडल खोज और प्रबंधन के साथ GUI इंटरफ़ेस प्रदान करता है
- Jan - संवादात्मक उपयोग के लिए अनुकूलित सुव्यवस्थित इंटरफ़ेस
- GPT4All - एक-क्लिक मॉडल डाउनलोड के साथ डेस्कटॉप एप्लिकेशन
- Msty - प्रॉम्प्ट टेम्पलेट और इतिहास प्रबंधन के साथ पूर्ण-सुविधा वाला क्लाइंट
ये सभी एप्लिकेशन अपने डिफ़ॉल्ट मॉडल कैटलॉग में Llama 3.2 शामिल करते हैं और क्वांटाइज़ेशन संस्करणों को स्वचालित रूप से संभालते हैं।
मैनुअल सेटअप (उन्नत):
मॉडलों को 9 ट्रिलियन टोकन तक पर प्रशिक्षित किया गया था और ये 128k टोकन की लंबी संदर्भ लंबाई का समर्थन करते हैं। Hugging Face से BF16 या क्वांटाइज़्ड वेट डाउनलोड करें (meta-llama/Llama-3.2-1B, meta-llama/Llama-3.2-3B, आदि) और transformers + torch, या अनुकूलित सर्विंग के लिए vLLM जैसे विशेष फ्रेमवर्क का उपयोग करें।
सर्वोत्तम उपयोग के मामले
केवल-टेक्स्ट मॉडल (1B/3B):
- एज पर स्थानीय रूप से चलने वाले ऑन-डिवाइस उपयोग के मामले जैसे सारांशीकरण, निर्देश अनुसरण और पुनर्लेखन कार्य
- प्रॉम्प्ट पुनर्लेखन, बहुभाषी ज्ञान पुनर्प्राप्ति, सारांशीकरण कार्य, टूल उपयोग और स्थानीय रूप से चलने वाले सहायक
- मोबाइल AI-संचालित लेखन सहायक
- व्यक्तिगत ज्ञान प्रबंधन प्रणालियाँ
- फोन, टैबलेट और स्मार्ट उपकरणों पर रीयल-टाइम प्रोसेसिंग
विज़न मॉडल (11B/90B):
- दृश्य तर्क और छवि समझ के कार्य, जो Claude 3 Haiku जैसे बंद मॉडलों से आगे हैं
- दस्तावेज़ विश्लेषण (चार्ट, ग्राफ़, वित्तीय रिपोर्ट)
- छवि कैप्शनिंग और दृश्य ग्राउंडिंग
- मल्टीमॉडल दस्तावेज़ समझ और खोज
अक्सर पूछे जाने वाले प्रश्न
क्या मैं Llama 3.2 का व्यावसायिक उपयोग कर सकता हूँ?
Llama 3.2 एक गैर-अनन्य, विश्वव्यापी, गैर-हस्तांतरणीय और रॉयल्टी-मुक्त सीमित लाइसेंस के तहत प्रदान किया गया है जो उपयोग, पुनरुत्पादन, वितरण, प्रतिलिपि, व्युत्पन्न कार्यों का निर्माण और संशोधन की अनुमति देता है। यदि मासिक सक्रिय उपयोगकर्ता 700 मिलियन से अधिक हो जाते हैं, तो Meta के साथ एक अलग व्यावसायिक समझौता आवश्यक है, जिसमें शुल्क या उपयोग-आधारित रॉयल्टी शामिल हो सकती है।
कौन-सी संदर्भ लंबाई समर्थित है?
सभी Llama 3.2 मॉडल 128K संदर्भ लंबाई का समर्थन करते हैं, जो Llama 3.1 में पेश की गई विस्तारित टोकन क्षमता को बनाए रखती है। ध्यान दें कि क्वांटाइज़्ड इंस्ट्रक्ट संस्करणों की संदर्भ लंबाई घटाकर 8k कर दी गई है।
मुझे अपने उपकरण के लिए कौन-सा मॉडल आकार चुनना चाहिए?
RTX 4090 जैसे उपभोक्ता GPU पर इन्फरेंस के लिए, 3B मॉडल को FP16 में 7GB चाहिए लेकिन INT4 में क्वांटाइज़ करने पर केवल 1.8GB। फोन/एज पर अधिकतम पोर्टेबिलिटी के लिए 1B चुनें; जब आपके पास 2GB+ उपलब्ध हो तो बेहतर गुणवत्ता के लिए 3B चुनें। 8GB+ VRAM वाले डेस्कटॉप के लिए, पूर्ण-परिशुद्धता वाले 3B या क्वांटाइज़्ड 11B विज़न मॉडल का उपयोग करें।
क्या मल्टीमॉडल मॉडल प्रतिबंधित हैं?
मल्टीमॉडल मॉडलों के संबंध में, Llama 3.2 Community License Agreement के तहत दिए गए अधिकार तब नहीं दिए जाते जब आप यूरोपीय संघ में निवासी व्यक्ति हों, या ऐसी कंपनी हों जिसका प्रमुख व्यवसाय स्थान यूरोपीय संघ में हो। यह प्रतिबंध इन मल्टीमॉडल मॉडलों को शामिल करने वाले किसी उत्पाद या सेवा के अंतिम उपयोगकर्ताओं पर लागू नहीं होता।
स्रोत और क्रेडिट
मूल स्रोत: Meta Llama Official Blog & Hugging Face Model Cards