लोकल एआई · Microsoft Foundry Labs + Hugging Face
Phi-4: Microsoft का शक्तिशाली 14B तर्क मॉडल
फोटो: Shubham Dhage Unsplash पर
Phi-4 Microsoft का 14 अरब पैरामीटर वाला छोटा भाषा मॉडल है जिसे 9.8 ट्रिलियन टोकन के क्यूरेटेड सिंथेटिक और ऑर्गैनिक डेटा पर प्रशिक्षित किया गया है, जो तर्क और गणित बेंचमार्कों पर असाधारण प्रदर्शन प्राप्त करता है। कई आकारों (14B, 3.8B mini, 5.6B multimodal) में उपलब्ध, यह Ollama, LM Studio और अन्य टूल के माध्यम से उपभोक्ता हार्डवेयर पर स्थानीय रूप से चलता है, MIT लाइसेंस के साथ व्यावसायिक उपयोग को सक्षम करते हुए।
Phi-4 क्या है?
Phi-4 Microsoft का 14 अरब पैरामीटर वाला छोटा भाषा मॉडल है जिसे लगभग 9.8 ट्रिलियन टोकन के सिंथेटिक "पाठ्यपुस्तक-शैली" डेटा तथा फ़िल्टर किए गए सार्वजनिक दस्तावेजों और क्यूरेटेड शैक्षणिक सामग्री के संयोजन पर प्रशिक्षित किया गया है। मॉडल को पर्यवेक्षित फाइन-ट्यूनिंग और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन का उपयोग करके संरेखित किया गया है, 16K-टोकन संदर्भ विंडो के साथ।
Phi-4 MIT लाइसेंस के तहत जारी किया गया है, जो इसे व्यावसायिक और अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपयोग करने योग्य बनाता है। मॉडल को मेमोरी-सीमित वातावरणों में तर्क, गणित और कोड जनरेशन के लिए इंजीनियर किया गया है, MMLU पर 84.8%, MATH पर 80.4% और HumanEval पर 82.6% प्राप्त करते हुए।
उपलब्ध आकार और संस्करण
Phi-4 परिवार में तीन मुख्य मॉडल शामिल हैं:
- Phi-4 (14B) - जटिल तर्क और गणितीय समस्या-समाधान के लिए अनुकूलित फ्लैगशिप मॉडल, 16K-टोकन संदर्भ विंडो के साथ।
- Phi-4-mini (3.8B) - तर्क और 128K-संदर्भ कार्यों के लिए अनुकूलित। इस मॉडल में 200,000 शब्दों की शब्दावली है जो बढ़े हुए बहुभाषी समर्थन, ग्रुप्ड-क्वेरी अटेंशन, अंतर्निहित फंक्शन कॉलिंग, बेहतर निर्देश अनुसरण और साझा एम्बेडिंग की अनुमति देती है।
- Phi-4-multimodal (5.6B) - एक ही आर्किटेक्चर में भाषण, दृष्टि और टेक्स्ट को एकीकृत करता है। यह टेक्स्ट, ऑडियो और छवि को इनपुट के रूप में समर्थन करता है, जबकि आउटपुट के रूप में टेक्स्ट लौटाता है।
इसके अतिरिक्त, Microsoft ने उन्नत गणित और तार्किक कार्यों के लिए अनुकूलित विशेष तर्क संस्करण भी जारी किए हैं।
हार्डवेयर आवश्यकताएँ
GPU-आधारित इन्फरेंस (अनुशंसित):
- Phi-4 (14B) को Q4_K_M पर लगभग 9 GB VRAM चाहिए। Q8 पर लगभग 14 GB चाहिए। FP16 पर लगभग 28 GB चाहिए।
- Phi-4-mini (3.8B) को Q4_K_M पर केवल लगभग 2.5 GB चाहिए - यह किसी भी GPU में फिट होता है या केवल CPU पर चलता है।
- अनुशंसित: सर्वोत्तम गुणवत्ता-से-प्रदर्शन अनुपात के लिए Q5_K_M चलाते हुए 12 GB VRAM (RTX 4070, RTX 3060 12GB)।
केवल-CPU इन्फरेंस:
- न्यूनतम: केवल-CPU इन्फरेंस के लिए 16 GB सिस्टम RAM।
- GPU गति का एक अंश अपेक्षित करें, जो बैकग्राउंड या बैच कार्यों के लिए ठीक है लेकिन इंटरैक्टिव चैट के लिए धीमा है।
सिस्टम RAM:
- Windows 10/11, न्यूनतम 16 GB RAM (32 GB अनुशंसित)।
बेंचमार्क की मुख्य बातें
Phi-4 MMLU पर 84.8%, MATH पर 80.4% और HumanEval पर 82.6% प्राप्त करता है। 13 बेंचमार्कों में से, Phi-4 Llama 3.3 70B (इसके सबसे हालिया ओपन वेट प्रतिस्पर्धी) से छह पर और Qwen 2.5 से पाँच पर बेहतर प्रदर्शन करता है।
Phi-4 GPQA (स्नातक स्तर के प्रश्न और उत्तर) और MATH (प्रतियोगिता-स्तर की गणित समस्याएँ) पर Llama 3.3 70B, Qwen 2.5 और GPT-4o से बेहतर प्रदर्शन करता है। GPQA (स्नातक-स्तरीय STEM प्रश्न) और MATH (गणित प्रतियोगिताएँ) पर, यह अपने शिक्षक मॉडल GPT-4o से भी अधिक स्कोर करता है। यह HumanEval और HumanEval+ द्वारा मापे गए कोडिंग में भी किसी भी अन्य ओपन-वेट मॉडल से अधिक स्कोर करता है।
Phi-4 का ज्ञान कटऑफ जून 2024 है। मॉडल के प्रशिक्षण डेटा में इस तिथि तक की जानकारी शामिल है।
इसे स्थानीय रूप से कैसे चलाएँ
Ollama का उपयोग करना (अनुशंसित - सबसे आसान):
अपना टर्मिनल खोलें और कमांड ollama run phi4 निष्पादित करें। यह कमांड दो कार्य करता है: यह Ollama लाइब्रेरी से मॉडल वेट डाउनलोड करता है और तुरंत एक इंटरैक्टिव चैट सत्र शुरू करता है।
Phi-4-mini के लिए, उपयोग करें: ollama run phi4-mini
Ollama Windows पर GPU का पता लगाना स्वचालित रूप से संभालता है। NVIDIA, AMD (ROCm) और Apple Silicon पर GPU स्वतः पहचाना जाता है। Ollama डिफ़ॉल्ट रूप से Q4_K_M का उपयोग करता है। 8GB GPU पर यह स्वचालित रूप से ओवरफ्लो लेयरों को CPU RAM में ऑफलोड कर देगा।
LM Studio का उपयोग करना (GUI-आधारित):
LM Studio 0.4.12 Windows 10 और 11 पर Phi-4 और Phi-4-mini का पूरी तरह समर्थन करता है। यह चैट इंटरफ़ेस, मॉडल तुलना और GUI के साथ स्थानीय सर्वर मोड प्रदान करता है - कमांड लाइन की आवश्यकता नहीं। बस Discover टैब में "Phi-4" खोजें, Download पर क्लिक करें, फिर Run करें।
अन्य समर्थित टूल:
Ollama और LM Studio जैसे टूल के साथ, आप Qwen 3, Gemma 3 और DeepSeek-R1 जैसे मॉडल उपभोक्ता हार्डवेयर पर चला सकते हैं - और Phi-4 Jan, GPT4All और Msty सहित अन्य प्लेटफ़ॉर्मों पर व्यापक रूप से उपलब्ध है।
सर्वोत्तम उपयोग के मामले
- गणित और STEM तर्क - Phi-4 गणित की समस्याओं को हल करने, वैज्ञानिक अवधारणाओं का विश्लेषण करने और बहु-चरणीय तार्किक प्रमाणों पर काम करने में उत्कृष्ट है।
- कोड जनरेशन और डीबगिंग - कोडिंग बेंचमार्कों पर मजबूत प्रदर्शन इसे सॉफ्टवेयर विकास सहायता के लिए आदर्श बनाता है।
- स्थानीय गोपनीयता-महत्वपूर्ण अनुप्रयोग - क्लाउड सेवाओं को डेटा भेजे बिना अपने स्वयं के हार्डवेयर पर AI को पूरी तरह ऑफ़लाइन चलाएँ।
- संसाधन-सीमित वातावरण - मामूली उपभोक्ता GPU (12GB VRAM) या यहाँ तक कि केवल-CPU सिस्टमों पर परिनियोजित करें।
- शैक्षिक और अनुसंधान टूल - उच्च तर्क गुणवत्ता के साथ दस्तावेजों का विश्लेषण करें, अवधारणाओं को समझाएँ और सीखने की सामग्री उत्पन्न करें।
- पैमाने पर लागत-प्रभावी इन्फरेंस - प्रारंभिक हार्डवेयर निवेश के बाद, उच्च-मात्रा उपयोग के लिए शून्य प्रति-टोकन लागत।
ध्यान दें: Phi-4 कुछ कार्यों के लिए अपने आकार से मौलिक रूप से सीमित है, विशेष रूप से तथ्यात्मक ज्ञान के आसपास भ्रम (hallucinations) में।
अक्सर पूछे जाने वाले प्रश्न
क्या मैं Phi-4 को 8 GB GPU VRAM वाले लैपटॉप पर चला सकता हूँ?
हाँ, लेकिन CPU ऑफलोडिंग के साथ। Q4_K_M पर Phi-4 को ~9 GB चाहिए - RTX 4060 8GB की सीमा से लगभग 1 GB अधिक। Ollama और llama.cpp कुछ लेयरों को सिस्टम RAM में रखकर ओवरफ्लो को स्वचालित रूप से संभालते हैं। मॉडल चलता है लेकिन 12 GB GPU की तुलना में ~50% धीमा है।
Phi-4 और Phi-4-mini में क्या अंतर है?
Phi-4 14B पैरामीटर है जबकि Phi-4-mini 3.8B पैरामीटर है, जो तर्क और 128K-संदर्भ कार्यों के लिए अनुकूलित है। Phi-4-mini अधिक कुशल है लेकिन थोड़ा कम शक्तिशाली, जबकि Phi-4 अधिक VRAM आवश्यकताओं की कीमत पर मजबूत तर्क प्रदान करता है।
क्या Phi-4 व्यावसायिक रूप से उपयोग करने के लिए मुफ्त है?
हाँ। Phi-4 14B MIT के तहत जारी किया गया है, एक अनुमतिपूर्ण ओपन-सोर्स लाइसेंस जो व्यावसायिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है।
क्लाउड API की तुलना में Phi-4 कितना तेज़ है?
अनुमानित टोकन/सेकंड मिड-रेंज GPU पर लगभग 20 टोकन/सेकंड और हाई-एंड कार्डों पर 55 टोकन/सेकंड तक के क्रम का है, यह मानते हुए कि क्वांटाइज़ेशन पूरी तरह VRAM में फिट होता है। गति हार्डवेयर के अनुसार बदलती है; Ollama और LM Studio अनुकूलन स्वचालित रूप से संभालते हैं।
स्रोत और क्रेडिट
मूल स्रोत: Microsoft Foundry Labs + Hugging Face