Reupload
पीसी जांच
होम पर वापस जाएं

लोकल एआई · Google AI Developers Blog & Official Documentation

Gemma 2: ओपन-वेट मॉडल की पूर्ण गाइड

Gemma 2: ओपन-वेट मॉडल की पूर्ण गाइड

फोटो: Growtika Unsplash पर

Gemma 2 Google के स्वतंत्र रूप से डाउनलोड करने योग्य बड़े भाषा मॉडलों का परिवार है जो 2B, 9B और 27B पैरामीटर आकारों में उपलब्ध है। Gemini से डिस्टिल्ड और ज्ञान डिस्टिलेशन के साथ प्रशिक्षित, ये मॉडल अपने से कई गुना बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन देते हैं जबकि उपभोक्ता हार्डवेयर पर कुशलता से चलते हैं। अनुमतिपूर्ण लाइसेंस के तहत उपलब्ध और Ollama, LM Studio तथा अन्य स्थानीय इन्फरेंस टूल के साथ संगत।

Gemma 2 क्या है?

Gemma 2 Google के ओपन बड़े भाषा मॉडलों का परिवार है, जो 2B, 9B और 27B पैरामीटर आकारों में पेश किया गया है। ये हल्के, अत्याधुनिक ओपन मॉडल अपने आकार के लिए सर्वश्रेष्ठ प्रदर्शन देते हैं, और यहाँ तक कि 2-3 गुना बड़े मॉडलों के लिए प्रतिस्पर्धी विकल्प भी प्रदान करते हैं।

Gemma 2 2B संसाधन-सीमित एज और मोबाइल परिनियोजन के लिए Google द्वारा विकसित एक संक्षिप्त, ओपन-वेट भाषा मॉडल है, जो बड़ी Gemini आर्किटेक्चरों से डिस्टिल किया गया है। Gemma 2 व्यावसायिक-अनुकूल Gemma लाइसेंस के तहत उपलब्ध है, जो डेवलपर्स और शोधकर्ताओं को अपने नवाचारों को साझा करने और व्यावसायीकरण करने की क्षमता देता है।

उपलब्ध आकार और संस्करण

Gemma 2 2B, 9B और 27B पैरामीटर आकारों में उपलब्ध है। प्रत्येक आकार दो संस्करणों में आता है:

  • बेस मॉडल: प्री-ट्रेंड, फाइन-ट्यूनिंग और अनुसंधान के लिए उपयुक्त
  • इंस्ट्रक्शन-ट्यून्ड (IT): संवादात्मक कार्यों और उपयोगकर्ता इंटरैक्शनों के लिए अनुकूलित

तकनीकी विशिष्टताएँ

  • संदर्भ लंबाई: सभी मॉडल 8,192 टोकन की अनुक्रम लंबाई का समर्थन करते हैं।
  • शब्दावली आकार: 256,128 टोकन (प्रतिस्पर्धी मॉडलों से काफी बड़ी)
  • आर्किटेक्चर: डिकोडर-ओनली डिज़ाइन वाला सघन ट्रांसफ़ॉर्मर
  • प्रशिक्षण डेटा: 9B मॉडल का प्रशिक्षण कॉर्पस 8 ट्रिलियन टोकन का था, मुख्यतः वेब दस्तावेजों, कोड और गणितीय सामग्री से।

हार्डवेयर आवश्यकताएँ

मेमोरी आवश्यकताएँ (पूर्ण परिशुद्धता FP16)

Gemma 2 2B: 1K टोकन पर 5.76 GB VRAM, 8K टोकन पर 6.16 GB VRAM। एकल RTX 4090 या समकक्ष इसे आराम से संभाल लेता है।

Gemma 2 9B: पूर्ण परिशुद्धता के लिए आमतौर पर 18-20 GB VRAM चाहिए। NVIDIA A100 40GB या 24GB VRAM वाले RTX 4090 जैसे GPU कम बैच आकारों के साथ Gemma 2 2B को फाइन-ट्यून कर सकते हैं।

Gemma 2 27B: 8,192 टोकन के साथ पूर्ण परिशुद्धता (FP16) पर, 61.44 GB VRAM चाहिए, जो 1x NVIDIA A100 80GB, 3x RTX 4090 24GB, या 1x Apple M3 Max 128GB के लिए उपयुक्त है।

क्वांटाइज़ेशन विकल्प

  • INT8 क्वांटाइज़ेशन: मेमोरी को (लगभग) आधा कर देता है
  • INT4 क्वांटाइज़ेशन: और घटाकर मूल आकार का 1/4 कर देता है, लैपटॉप इन्फरेंस को सक्षम बनाता है
  • GGUF प्रारूप: Ollama और समान टूल के साथ CPU-आधारित इन्फरेंस के लिए अनुकूलित

Q4 क्वांटाइज़ेशन में Gemma 2B (लगभग 1.4GB) 4GB RAM वाले Raspberry Pi 4 पर चल सकता है, जो लगभग 3-5 टोकन प्रति सेकंड देता है।

बेंचमार्क की मुख्य बातें

Gemma 2 मॉडल कई मूल्यांकन फ्रेमवर्कों में अपने पैरामीटर गणना के सापेक्ष असाधारण प्रदर्शन प्रदर्शित करते हैं।

LMSYS Chatbot Arena (मानव मूल्यांकन)

Gemma 27B (Elo 1218) ने Llama 3 70B (Elo 1206) से ऊपर रैंक किया, Gemma 9B (Elo 1187) GPT-4-0314 (Elo 1186) के समान, Gemma 2.6B (Elo 1126) ने GPT-3.5-Turbo-0613 (Elo 1116) से ऊपर रैंक किया।

शैक्षणिक बेंचमार्क

MMLU बेंचमार्क पर, Gemma 2 2B 52.2% स्कोर करता है, Gemma 2 9B 71.3% स्कोर करता है, और Gemma 2 27B 75.2% स्कोर करता है। अतिरिक्त स्कोर:

  • GSM8K (गणित): Gemma 2 9B: 68.6%, Gemma 2 27B: 74.0%
  • HumanEval (कोड): Gemma 2 9B: 68.2%, Gemma 2 27B: 74.9%
  • BBH (तर्क): Gemma 2 9B: 68.2%, Gemma 2 27B: 74.9%

मुख्य उपलब्धि

27B मॉडल तेज़ी से LMSYS Chatbot Arena लीडरबोर्ड पर चढ़ा, आकर्षक, वास्तविक दुनिया की बातचीतों में अपने से दोगुने से अधिक आकार के लोकप्रिय मॉडलों को भी पीछे छोड़ते हुए, जबकि Gemma 2 2B मॉडल Chatbot Arena पर सभी GPT-3.5 मॉडलों से बेहतर प्रदर्शन करता है, ऐसे आकार में जो एज उपकरणों पर चल सकता है।

इसे स्थानीय रूप से कैसे चलाएँ

Ollama का उपयोग करना (सबसे आसान तरीका)

Gemma 2 Hugging Face Transformers, JAX, PyTorch, Keras 3.0 के माध्यम से TensorFlow, vLLM, Gemma.cpp, Llama.cpp और Ollama सहित प्रमुख AI फ्रेमवर्कों के साथ संगत है।

इंस्टॉलेशन और उपयोग:

  1. ollama.com से Ollama इंस्टॉल करें
  2. इनमें से कोई एक कमांड चलाएँ:
  • 2B पैरामीटर: ollama run gemma2:2b
  • 9B पैरामीटर: ollama run gemma2
  • 27B पैरामीटर: ollama run gemma2:27b

वैकल्पिक टूल

अन्य लोकप्रिय स्थानीय इन्फरेंस प्लेटफ़ॉर्म भी Gemma 2 का समर्थन करते हैं:

  • LM Studio: lmstudio.ai से डाउनलोड करें, मॉडल प्रबंधन के लिए GUI प्रदान करता है
  • Jan: समान कार्यक्षमता वाला ओपन-सोर्स विकल्प
  • GPT4All: पूर्व-कॉन्फ़िगर मॉडलों के साथ शुरुआती-अनुकूल इंटरफ़ेस
  • Msty: स्थानीय LLM इन्फरेंस के लिए क्रॉस-प्लेटफ़ॉर्म डेस्कटॉप एप्लिकेशन

ये सभी टूल आपको अपने अंतर्निहित मॉडल कैटलॉग से Gemma 2 के क्वांटाइज़्ड संस्करण डाउनलोड करने और उन्हें ऑफ़लाइन चलाने की अनुमति देते हैं।

सर्वोत्तम उपयोग के मामले

Gemma 2 9B कविता, कॉपीराइटिंग और कोड जनरेशन जैसी सामग्री निर्माण के लिए उपयुक्त है, इंस्ट्रक्शन-ट्यून्ड संस्करण विशेष रूप से संवादात्मक एजेंटों और चैटबॉटों के लिए प्रभावी हैं, प्रश्न उत्तर और सारांशीकरण जैसे कार्यों का समर्थन करते हुए।

आदर्श अनुप्रयोग:

  • एज उपकरण और मोबाइल: 2B मॉडल फोन और एम्बेडेड सिस्टमों पर कुशलता से चलता है
  • कोड जनरेशन और सहायता: HumanEval और कोडिंग बेंचमार्कों पर मजबूत प्रदर्शन
  • दस्तावेज़ सारांशीकरण: उच्च-गुणवत्ता वाला एब्स्ट्रैक्टिव और एक्सट्रैक्टिव सारांशीकरण
  • ग्राहक सेवा चैटबॉट: इंस्ट्रक्शन-ट्यून्ड संस्करण उपयोगकर्ता-मुखी संवाद में उत्कृष्ट हैं
  • स्थानीय गोपनीयता-प्रथम परिनियोजन: बाहरी API कॉल के बिना पूर्ण डेटा नियंत्रण
  • शैक्षिक टूल: शिक्षक/छात्र प्रश्न-उत्तर प्रणालियाँ और ट्यूटरिंग अनुप्रयोग
  • लागत-प्रभावी इन्फरेंस: एकल GPU या CPU परिनियोजन परिचालन लागत कम करता है

अक्सर पूछे जाने वाले प्रश्न

क्या Gemma 2 बिना GPU के पूरी तरह मेरे लैपटॉप पर चल सकता है?

Gemma 2 का अपेक्षाकृत छोटा आकार इन्हें लैपटॉप, डेस्कटॉप या आपके स्वयं के क्लाउड इन्फ्रास्ट्रक्चर जैसे सीमित संसाधनों वाले वातावरणों में परिनियोजित करना संभव बनाता है। 2B मॉडल CPU पर चल सकता है, हालाँकि गति धीमी होगी (कुछ टोकन प्रति सेकंड)। INT4 प्रारूप में क्वांटाइज़ेशन मेमोरी आवश्यकताओं को और कम करता है।

Gemma 2 बेस और इंस्ट्रक्शन-ट्यून्ड मॉडलों में क्या अंतर है?

बेस मॉडल प्री-ट्रेंड हैं और कस्टम कार्यों पर फाइन-ट्यूनिंग के लिए अनुकूलित हैं। इंस्ट्रक्शन-ट्यून्ड (IT) संस्करण उपयोगकर्ता निर्देशों का पालन करने और संवाद में शामिल होने के लिए अतिरिक्त प्रशिक्षण से गुजरते हैं, जिससे वे बिना और प्रशिक्षण के चैटबॉट के रूप में तुरंत उपयोग के लिए तैयार हो जाते हैं।

क्या Gemma 2 वास्तव में ओपन सोर्स है?

Gemma मॉडल पूरी तरह ओपन सोर्स के बजाय "ओपन-वेट" हैं - वेट स्वतंत्र रूप से उपलब्ध हैं लेकिन प्रशिक्षण डेटा और कोड नहीं हैं। अनुमतिपूर्ण लाइसेंस फिर भी मॉडल वेट के व्यावसायिक उपयोग और पुनर्वितरण की अनुमति देता है।

Gemma 2 की Llama 3 से तुलना कैसे होती है?

9B Gemma 2 मॉडल श्रेणी-अग्रणी प्रदर्शन देता है, अपनी आकार श्रेणी में Llama 3 8B और अन्य ओपन मॉडलों से बेहतर प्रदर्शन करते हुए। 27B संस्करण छोटा होने के बावजूद बहुत बड़े Llama 3 मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

जानना चाहते हैं कि आपका कंप्यूटर लोकल एआई चला सकता है या नहीं?

स्रोत और क्रेडिट

मूल स्रोत: Google AI Developers Blog & Official Documentation