ذكاء اصطناعي محلي · Microsoft Foundry Labs + Hugging Face
Phi-4: نموذج الاستدلال القوي من مايكروسوفت بحجم 14B
الصورة: Shubham Dhage على Unsplash
Phi-4 هو نموذج لغوي صغير من مايكروسوفت بـ14 مليار معامل دُرّب على 9.8 تريليون رمز من بيانات اصطناعية وعضوية منسّقة، محققًا أداءً استثنائيًا في معايير الاستدلال والرياضيات. وهو متاح بأحجام متعددة (14B، و3.8B mini، و5.6B متعدد الوسائط)، ويعمل محليًا على أجهزة استهلاكية عبر Ollama وLM Studio وأدوات أخرى، بترخيص MIT يتيح الاستخدام التجاري.
ما هو Phi-4؟
Phi-4 هو نموذج لغوي صغير من مايكروسوفت بـ14 مليار معامل دُرّب على نحو 9.8 تريليون رمز من بيانات اصطناعية "على نمط الكتب المدرسية" مدمجة مع مستندات عامة مُرشَّحة ومواد أكاديمية منسّقة. ويُواءَم النموذج باستخدام الضبط الدقيق المُوجَّه وتحسين التفضيلات المباشر، مع نافذة سياق تبلغ 16 ألف رمز.
يُصدر Phi-4 بموجب ترخيص MIT، ما يجعله قابلًا للاستخدام بحرية لأغراض تجارية وبحثية. وقد صُمم النموذج للاستدلال والرياضيات وتوليد الشيفرة في بيئات محدودة الذاكرة، محققًا 84.8% في MMLU، و80.4% في MATH، و82.6% في HumanEval.
الأحجام والمتغيرات المتاحة
تضم عائلة Phi-4 ثلاثة نماذج رئيسية:
- Phi-4 (14B) - النموذج الرئيسي المحسّن للاستدلال المعقد وحل المسائل الرياضية، بنافذة سياق تبلغ 16 ألف رمز.
- Phi-4-mini (3.8B) - محسّن للاستدلال ومهام السياق الطويل حتى 128K. ويتميز هذا النموذج بمفردات من 200,000 كلمة تتيح دعمًا متعدد اللغات موسّعًا، وانتباه الاستعلامات المُجمَّعة، واستدعاء دوال مدمج، واتباع تعليمات محسّن، وتضمين مشترك.
- Phi-4-multimodal (5.6B) - يوحد الكلام والرؤية والنص في معمارية واحدة. ويدعم النص والصوت والصورة كمدخلات، مع إرجاع النص كمخرجات.
إضافة إلى ذلك، أصدرت مايكروسوفت متغيرات استدلال متخصصة محسّنة للمهام الرياضية والمنطقية المتقدمة.
متطلبات الأجهزة
الاستدلال عبر وحدة الرسومات (موصى به):
- يحتاج Phi-4 (14B) عند Q4_K_M إلى نحو 9 جيجابايت من VRAM. وعند Q8 يحتاج إلى نحو 14 جيجابايت. وعند FP16 يحتاج إلى نحو 28 جيجابايت.
- يحتاج Phi-4-mini (3.8B) عند Q4_K_M إلى نحو 2.5 جيجابايت فقط - فيتسع على أي وحدة رسومات أو يعمل على المعالج فقط.
- الموصى به: 12 جيجابايت VRAM (RTX 4070، RTX 3060 12GB) مع تشغيل Q5_K_M للحصول على أفضل نسبة جودة إلى أداء.
الاستدلال على المعالج فقط:
- الحد الأدنى: 16 جيجابايت من ذاكرة النظام للاستدلال على المعالج فقط.
- توقّع جزءًا من سرعة وحدة الرسومات، وهو مقبول للمهام الخلفية أو الدفعية لكنه بطيء للمحادثة التفاعلية.
ذاكرة النظام:
- Windows 10/11، و16 جيجابايت RAM كحد أدنى (يُنصح بـ32 جيجابايت).
أبرز نتائج المعايير
يحقق Phi-4 نسبة 84.8% في MMLU، و80.4% في MATH، و82.6% في HumanEval. ومن بين 13 معيارًا، يتفوق Phi-4 على Llama 3.3 70B (أحدث منافس له مفتوح الأوزان) في ستة، وعلى Qwen 2.5 في خمسة.
يتفوق Phi-4 على Llama 3.3 70B وQwen 2.5 وGPT-4o في GPQA (أسئلة وأجوبة بمستوى الدراسات العليا) وMATH (مسائل رياضية بمستوى المسابقات). وفي GPQA (أسئلة STEM بمستوى الدراسات العليا) وMATH (مسابقات الرياضيات)، يتفوق حتى على نموذجه المعلّم، GPT-4o. كما يسجل نتائج أعلى في البرمجة، وفق قياس HumanEval وHumanEval+، من أي نموذج آخر مفتوح الأوزان.
تاريخ قطع معرفة Phi-4 هو يونيو 2024. وتشمل بيانات تدريب النموذج معلومات حتى هذا التاريخ.
كيفية تشغيله محليًا
باستخدام Ollama (موصى به - الأسهل):
افتح الطرفية ونفّذ الأمر ollama run phi4. ينفذ هذا الأمر إجراءين: ينزّل أوزان النموذج من مكتبة Ollama ويطلق فورًا جلسة محادثة تفاعلية.
ولـ Phi-4-mini، استخدم: ollama run phi4-mini
يتعامل Ollama مع كشف وحدة الرسومات تلقائيًا على Windows. ويُكتشف GPU تلقائيًا على NVIDIA وAMD (ROCm) وApple Silicon. ويعتمد Ollama افتراضيًا على Q4_K_M. وعلى وحدة رسومات بسعة 8 جيجابايت، سيُفرِّغ تلقائيًا الطبقات الزائدة إلى ذاكرة النظام.
باستخدام LM Studio (قائم على الواجهة الرسومية):
يدعم LM Studio 0.4.12 بالكامل Phi-4 وPhi-4-mini على Windows 10 و11. ويوفر واجهة محادثة ومقارنة نماذج ووضع خادم محلي بواجهة رسومية - دون حاجة إلى سطر أوامر. ما عليك سوى البحث عن "Phi-4" في تبويب Discover، ثم النقر على Download، ثم Run.
أدوات أخرى مدعومة:
باستخدام أدوات مثل Ollama وLM Studio، يمكنك تشغيل نماذج مثل Qwen 3 وGemma 3 وDeepSeek-R1 على أجهزة استهلاكية - كما أن Phi-4 متاح على نطاق واسع عبر منصات أخرى منها Jan وGPT4All وMsty.
أفضل حالات الاستخدام
- الرياضيات والاستدلال في STEM - يتفوق Phi-4 في حل المسائل الرياضية وتحليل المفاهيم العلمية والعمل عبر البراهين المنطقية متعددة الخطوات.
- توليد الشيفرة وتصحيح الأخطاء - أداء قوي في معايير البرمجة يجعله مثاليًا للمساعدة في تطوير البرمجيات.
- التطبيقات المحلية الحساسة للخصوصية - شغّل الذكاء الاصطناعي بالكامل دون اتصال على أجهزتك الخاصة دون إرسال بيانات إلى خدمات سحابية.
- البيئات محدودة الموارد - انشره على وحدات رسومات استهلاكية متواضعة (12 جيجابايت VRAM) أو حتى على أنظمة تعمل بالمعالج فقط.
- الأدوات التعليمية والبحثية - حلّل المستندات واشرح المفاهيم وأنتج مواد تعليمية بجودة استدلال عالية.
- الاستدلال الفعّال من حيث التكلفة على نطاق واسع - بعد الاستثمار الأولي في العتاد، لا تكاليف لكل رمز عند الاستخدام الكثيف.
ملاحظة: لا يزال Phi-4 محدودًا جوهريًا بحجمه في بعض المهام، وتحديدًا في الهلوسة المتعلقة بالمعرفة الواقعية.
الأسئلة الشائعة
هل يمكنني تشغيل Phi-4 على حاسوب محمول بذاكرة VRAM لوحدة رسومات بسعة 8 جيجابايت؟
نعم، لكن مع تفريغ إلى المعالج. يحتاج Phi-4 عند Q4_K_M إلى نحو 9 جيجابايت - أي نحو 1 جيجابايت فوق حد RTX 4060 8GB. ويتعامل Ollama وllama.cpp مع الفائض تلقائيًا بإبقاء بعض الطبقات في ذاكرة النظام. يعمل النموذج لكنه أبطأ بنحو 50% من وحدة رسومات بسعة 12 جيجابايت.
ما الفرق بين Phi-4 وPhi-4-mini؟
Phi-4 بـ14 مليار معامل بينما Phi-4-mini بـ3.8 مليار معامل، محسّن للاستدلال ومهام السياق حتى 128K. Phi-4-mini أكثر كفاءة لكنه أقل قوة قليلًا، بينما يوفر Phi-4 استدلالًا أقوى مقابل متطلبات VRAM أعلى.
هل استخدام Phi-4 مجاني تجاريًا؟
نعم. يُصدر Phi-4 14B بموجب MIT، وهو ترخيص مفتوح المصدر متسامح يتيح الاستخدام التجاري والتعديل وإعادة التوزيع.
ما مدى سرعة Phi-4 مقارنة بواجهات السحابة البرمجية؟
تُقدَّر السرعة بنحو 20 رمزًا في الثانية على وحدة رسومات متوسطة المدى وتصل إلى 55 رمزًا في الثانية على البطاقات الراقية، بافتراض أن التكميم يتسع بالكامل في VRAM. تختلف السرعة حسب العتاد؛ ويتعامل Ollama وLM Studio مع التحسين تلقائيًا.
المصادر والاعتمادات
المصدر الأصلي: Microsoft Foundry Labs + Hugging Face