Reupload
पीसी जांच
होम पर वापस जाएं

लोकल एआई · Ollama Official Documentation & Community Sources

Ollama के साथ AI मॉडल स्थानीय रूप से चलाएँ - 2026

Ollama के साथ AI मॉडल स्थानीय रूप से चलाएँ - 2026

फोटो: Nakul Unsplash पर

Ollama एक ओपन-सोर्स टूल है जो आपको अपनी स्थानीय मशीन पर बड़े भाषा मॉडल डाउनलोड करने, चलाने और प्रबंधित करने देता है, और AI मॉडलों के लिए Docker की तरह काम करता है: आप एक ही कमांड से मॉडल पुल करते हैं, और यह क्वांटाइज़ेशन, मेमोरी प्रबंधन तथा GPU एक्सेलेरेशन को स्वतः संभाल लेता है। निजता, लागत और नियंत्रण - ये तीन मुख्य कारण हैं जिनकी वजह से लोग Ollama के साथ स्थानीय AI चलाते हैं, और अकेले Llama 3.1 के लिए इसने 112 मिलियन से अधिक मॉडल पुल जमा किए हैं और अगस्त 2026 तक $88 मिलियन की फंडिंग जुटाई है।

Ollama क्या है?

Ollama एक ओपन-सोर्स टूल है जो आपको अपनी स्थानीय मशीन पर बड़े भाषा मॉडल डाउनलोड करने, चलाने और प्रबंधित करने देता है, और क्वांटाइज़ेशन, मेमोरी प्रबंधन तथा GPU एक्सेलेरेशन को स्वतः संभालता है। 8 जुलाई 2023 को जारी किया गया Ollama, Jeffrey Morgan और Michael Chiang द्वारा विकसित किया गया है और MIT लाइसेंस के अंतर्गत लाइसेंस प्राप्त है। Ollama में मॉडल चलाने और प्रबंधित करने के लिए एक REST API शामिल है, जो इसे CLI उपयोग और प्रोग्रामेटिक इंटीग्रेशन दोनों के लिए लचीला बनाता है।

Ollama एक सक्रिय मॉडल लाइब्रेरी प्रदान करता है जिसमें सैकड़ों मॉडल उपलब्ध हैं और नियमित रूप से अपडेट होते रहते हैं, macOS, Windows और Linux पर क्रॉस-प्लेटफ़ॉर्म काम करता है, और उपलब्ध होने पर Apple Silicon, NVIDIA तथा AMD GPUs का स्वतः उपयोग करता है। निजता, लागत और नियंत्रण - ये तीन मुख्य कारण हैं जिनकी वजह से लोग Ollama के साथ स्थानीय AI की ओर बार-बार लौटते हैं।

इंस्टॉलेशन और सेटअप

सिस्टम आवश्यकताएँ

जाँचें कि आपका हार्डवेयर न्यूनतम आवश्यकताओं को पूरा करता है: 16 GB RAM, एक आधुनिक CPU या अपने लक्षित मॉडल आकार के लिए पर्याप्त VRAM वाला GPU। अधिक विस्तार से:

  • छोटे मॉडलों (1B, 3B, 7B) के लिए 8GB RAM न्यूनतम है, हालाँकि प्रदर्शन खराब हो सकता है; 7B और 13B मॉडलों के साथ सहज प्रदर्शन के लिए 16GB अनुशंसित है।
  • बड़े मॉडलों (30B, 40B, 70B) के लिए 32GB या अधिक सर्वोत्तम है।
  • समर्थित Linux वितरणों में Ubuntu 22.04/24.04 LTS, Debian 11/12, Fedora 39/40, RHEL 9+, Rocky Linux, AlmaLinux और Arch Linux शामिल हैं; आर्किटेक्चर x86_64 (AMD64) या ARM64 (aarch64) होना चाहिए; Linux Kernel 5.15 या नया दृढ़ता से अनुशंसित है।
  • Ollama ऐप स्वयं macOS पर लगभग 180 MB का डाउनलोड, Windows पर लगभग 1.6 GB का इंस्टॉलर, और Linux पर लगभग 1.4 GB का बंडल है।

GPU समर्थन

  • Ollama Windows पर CUDA के साथ NVIDIA GPUs और ROCm के साथ AMD GPUs का समर्थन करता है; यदि आपके पास संगत GPU है, तो Ollama उसे स्वतः पहचानकर उपयोग करता है और अधिकांश मामलों में किसी मैनुअल कॉन्फ़िगरेशन की आवश्यकता नहीं होती।
  • NVIDIA GPU एक्सेलेरेशन के लिए NVIDIA ड्राइवर स्थापित और कार्यशील होना चाहिए; ड्राइवर संस्करण 525+ आवश्यक है, 550+ अनुशंसित है।
  • Linux पर NVIDIA उपयोगकर्ताओं को CUDA ड्राइवर अलग से स्थापित करने होते हैं; ROCm के माध्यम से AMD GPU समर्थन के लिए सामान्यतः RX 5000 सीरीज़ और नया चाहिए।

इंस्टॉलेशन के चरण

Homebrew (macOS), आधिकारिक इंस्टॉल स्क्रिप्ट (Linux), या winget (Windows) के माध्यम से Ollama स्थापित करें। उदाहरण:

  • Linux: curl -fsSL https://ollama.com/install.sh | sh
  • macOS: brew install ollama
  • Windows: ollama.com से डाउनलोड करें या winget install Ollama.Ollama का उपयोग करें

समर्थित मॉडल

पूरा मॉडल कैटलॉग ollama.com/library पर उपलब्ध है; अपनी मशीन पर मौजूद मॉडलों को देखने के लिए ollama list का उपयोग करें।

श्रेणी के अनुसार शीर्ष अनुशंसित मॉडल (2026):

  • छोटे, तेज़, 8GB RAM: Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
  • सर्वश्रेष्ठ सर्वांगीण, 16GB RAM: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
  • उच्च गुणवत्ता, 32GB+ / GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B
  • हाल के रिलीज़: 2026 के प्रमुख रिलीज़ों में Alibaba Qwen3.8-27B (अगस्त, सर्वश्रेष्ठ-सर्वांगीण), Poolside Laguna XS 2.1 (जुलाई), Google Gemma 4 (जून), और DeepSeek V4/Flash (अप्रैल) शामिल हैं।

Ollama डिफ़ॉल्ट रूप से 4-बिट क्वांटाइज़्ड संस्करण डाउनलोड करता है, यही कारण है कि एक '70B' मॉडल एक अच्छे वर्कस्टेशन पर फिट हो सकता है और '8B' एक लैपटॉप पर चलता है।

लाभ

  • शून्य लागत और ओपन-सोर्स: Ollama MIT लाइसेंस के अंतर्गत मुफ़्त और ओपन-सोर्स है; प्रोजेक्ट की ओर से कोई पेड टियर नहीं है, हालाँकि आप उस हार्डवेयर के लिए भुगतान करते हैं जिस पर यह चलता है।
  • पूर्ण निजता: आपका डेटा आपकी ही मशीन पर रहता है। कोई क्लाउड निर्भरता नहीं, कोई प्रति-टोकन बिल नहीं।
  • तेज़ सेटअप: अपनी ही मशीन पर एक सक्षम भाषा मॉडल चलाने में दस मिनट से भी कम समय लगता है।
  • OpenAI संगतता: Ollama में OpenAI Chat Completions API के साथ अंतर्निहित संगतता है, जिससे स्थानीय रूप से Ollama के साथ अधिक टूलिंग और एप्लिकेशनों का उपयोग संभव हो जाता है।
  • स्वतः GPU एक्सेलेरेशन: यदि आपके पास संगत GPU है, तो Ollama उसे स्वतः पहचानकर उपयोग करता है।
  • कई इंटरफ़ेस विकल्प: उपयोगकर्ता कमांड लाइन से मॉडल चला सकते हैं, स्थानीय HTTP API के माध्यम से उनसे इंटरैक्ट कर सकते हैं, या Python और JavaScript के लिए क्लाइंट लाइब्रेरीज़ का उपयोग कर सकते हैं।

कमियाँ

  • CLI-प्रथम दृष्टिकोण: हर इंटरैक्शन के लिए टर्मिनल कमांड चाहिए; कोई ग्राफ़िकल इंटरफ़ेस नहीं, कोई विज़ुअल मॉडल ब्राउज़र नहीं, कोई पॉइंट-एंड-क्लिक सरलता नहीं।
  • गैर-तकनीकी उपयोगकर्ताओं के लिए कठिन सीखने की अवस्था: Ollama पूरी तरह कमांड-लाइन इंटरफ़ेस पर निर्भर है और इसके साथ सीखने की तीव्र अवस्था आती है, विशेष रूप से नए लोगों या गैर-तकनीकी उपयोगकर्ताओं के लिए जो विज़ुअल मॉडल प्रबंधन पसंद करते हैं।
  • कोई अंतर्निहित चैट UI नहीं: Ollama में ग्राफ़िकल चैट UI शामिल नहीं है; आप टर्मिनल कमांड के माध्यम से इंटरैक्ट करते हैं या तीसरे पक्ष के वेब इंटरफ़ेस स्थापित और कॉन्फ़िगर करते हैं।
  • सीमित एंटरप्राइज़ सुविधाएँ: Ollama में व्यापक एंटरप्राइज़-स्तरीय सुविधाओं का अभाव है, जैसे बड़े पैमाने पर परिनियोजन समर्थन, सहयोग उपकरण और सुरक्षा उपकरण; यह जटिल अवसंरचना या व्यापक अनुपालन आवश्यकताओं वाली कंपनियों के लिए उपयुक्त नहीं है।
  • क्लाउड से धीमा प्रदर्शन: स्थानीय मॉडल क्लाउड विकल्पों की तुलना में काफ़ी धीमे चलते हैं, बुनियादी आउटपुट के लिए 10-30 सेकंड का इंतज़ार करना पड़ता है।
  • सीमित अनुकूलनशीलता: Ollama अनुकूलनशीलता की कीमत पर सरलता के बारे में है; यदि आप किसी मॉडल के हर विवरण को बारीकी से ट्यून करना पसंद करते हैं, तो Ollama बहुत प्रतिबंधात्मक लग सकता है।
  • कोई अंतर्निहित बातचीत इतिहास नहीं: Ollama स्वयं बातचीत का इतिहास सहेजता नहीं है; आप या तो कोई बाहरी UI उपयोग करते हैं जो इतिहास प्रबंधित करता है, या टर्मिनल बंद करते ही अपनी बातचीत खो देते हैं।

सर्वोत्तम उपयोग के मामले

  • स्थानीय विकास और प्रोटोटाइपिंग: Ollama का उपयोग तब करें जब आप अपने ही हार्डवेयर पर निजी तौर पर LLM चलाना चाहते हैं - ऑफ़लाइन काम, संवेदनशील डेटा, स्थानीय प्रोटोटाइपिंग, या किसी एप्लिकेशन के पीछे शून्य-लागत इन्फ़रेंस बैकएंड के रूप में।
  • कोड सहायता और RAG पाइपलाइनें: Ollama 7B-14B मॉडलों को 30-60 टोकन/सेकंड की दर से सहजता से संभालता है, जो कोड सहायता, चैट और RAG पाइपलाइनों के लिए पर्याप्त अच्छा है।
  • निजता-महत्वपूर्ण वर्कफ़्लो: डेटा निजता अनिवार्यताएँ, अप्रत्याशित API मूल्य निर्धारण, और ऑफ़लाइन-सक्षम वर्कफ़्लो की बढ़ती आवश्यकता - ये सभी अपनाने को बढ़ावा देते हैं।
  • एप्लिकेशनों में एम्बेडेड AI: OpenAI इंटरफ़ेस को लागू करके, Ollama स्वयं को उस पूरे टूल पारिस्थितिकी तंत्र के लिए ड्रॉप-इन बैकएंड बना देता है जो OpenAI API को लक्षित करके बनाया गया है, बिना स्पष्ट Ollama समर्थन की आवश्यकता के।

अक्सर पूछे जाने वाले प्रश्न

क्या Ollama पूरी तरह मुफ़्त है?

हाँ, Ollama MIT लाइसेंस के अंतर्गत मुफ़्त और ओपन-सोर्स है। Ollama पूरी तरह मुफ़्त है, स्वयं सॉफ़्टवेयर के लिए कोई सदस्यता शुल्क, उपयोग सीमा या छिपी लागत नहीं है।

Ollama और OpenAI जैसे क्लाउड AI API में क्या अंतर है?

Ollama निजता, ऑफ़लाइन उपयोग और शून्य प्रति-टोकन लागत के बदले फ्रंटियर मॉडल गुणवत्ता का त्याग करता है; हार्डवेयर आपको देना होता है। Ollama स्थानीय विकास के लिए उत्कृष्ट है, लेकिन यह किसी प्रबंधित AI API गेटवे का विकल्प नहीं है, जब तक कि आपका ऐप स्थानीय रनटाइम बाधाओं को सहन न कर सके।

क्या मैं मौजूदा कोड के साथ Ollama के OpenAI-संगत API का उपयोग कर सकता हूँ?

OpenAI Python SDK, base_url='http://localhost:11434/v1' और api_key='ollama' सेट करके Ollama के साथ काम करता है, जिससे आपके एप्लिकेशन के बाकी हिस्से में शून्य कोड परिवर्तन के साथ सभी API कॉल आपके स्थानीय Ollama इंस्टेंस पर रीडायरेक्ट हो जाती हैं। आप विकास के दौरान असली OpenAI API के साथ प्रोटोटाइप बना सकते हैं और न्यूनतम कोड परिवर्तनों के साथ प्रोडक्शन या निजता-संवेदनशील परिनियोजन के लिए Ollama पर स्विच कर सकते हैं।

एक सामान्य लैपटॉप (8-16GB RAM) पर मुझे कौन से मॉडल चलाने चाहिए?

8GB RAM वाले किसी भी लैपटॉप पर Llama 3.2 3B, Phi-3 Mini, या Gemma 3 4B चलाएँ; 16GB RAM (सर्वश्रेष्ठ सर्वांगीण) के लिए Llama 3.1 8B, Qwen 2.5 7B, या Mistral 7B का उपयोग करें।

जानना चाहते हैं कि आपका कंप्यूटर लोकल एआई चला सकता है या नहीं?

स्रोत और क्रेडिट

मूल स्रोत: Ollama Official Documentation & Community Sources