ذكاء اصطناعي محلي · Meta Llama Official Blog & Hugging Face Model Cards
Llama 3.2: نماذج الرؤية والأوزان المفتوحة والنماذج الخفيفة
الصورة: Milad Fakurian على Unsplash
Llama 3.2 هي مجموعة من النماذج تشمل نماذج نصية خفيفة بمعاملات 1B و3B إلى جانب نماذج الرؤية واللغة بمعاملات 11B و90B. وتمتد هذه النماذج من نماذج نصية مناسبة للأجهزة الطرفية إلى نماذج متعددة الوسائط قادرة على مهام استدلال متقدمة. وصُممت Llama 3.2 لتُستغل محليًا وفي الاستدلال السحابي، وهي تمثل توجه Meta نحو إتاحة الذكاء الاصطناعي لمختلف فئات الأجهزة.
ما هي Llama 3.2؟
Llama 3.2 هي عائلة نماذج لغوية رائدة تتميز بقدرات محسّنة، وقابلية تطبيق أوسع، ودعم للصور متعدد الوسائط. ويشمل هذا الإصدار نماذج لغوية خفيفة ومتوسطة الحجم قادرة على معالجة الصور (11B و90B)، ونماذج نصية خفيفة فقط (1B و3B) يمكن تشغيلها على الأجهزة الطرفية والمحمولة، في نسختين: مدربة مسبقًا ومضبوطة بالتعليمات.
تُعدّ النماذج 11B و90B أول نماذج Llama تدعم مهام الرؤية، بمعمارية جديدة تدمج تمثيلات مُرمِّز الصور في النموذج اللغوي. أما النموذجان 1B و3B فهما مدعومان من اليوم الأول على أجهزة Qualcomm وMediaTek ومحسان لمعالجات Arm.
الأحجام والمتغيرات المتاحة
تقدم مجموعة Llama 3.2 نماذج بأحجام متنوعة، من نماذج نصية خفيفة بمعاملات 1B و3B مناسبة للأجهزة الطرفية، إلى نماذج صغيرة ومتوسطة الحجم بمعاملات 11B و90B قادرة على مهام استدلال متقدمة تشمل الدعم متعدد الوسائط للصور عالية الدقة.
النماذج النصية فقط (مدربة مسبقًا ومضبوطة بالتعليمات):
- Llama 3.2 1B تضم 1.23 مليار معامل؛ و3B تضم 3.21 مليار معامل
- كلاهما متاح بنسخ BF16 ومتغيرات مُكمَّمة (INT4/INT8)
- النسخ المضبوطة بالتعليمات والمكمَّمة لها طول سياق مخفَّض قدره 8k
نماذج الرؤية واللغة (متعددة الوسائط):
- متغيرات الرؤية 11B و90B لفهم الصور وتوليد النصوص
- يدعم النموذج الأساسي 11B أحجام البلاطات 448، بينما تستخدم النسخة المضبوطة بالتعليمات ونماذج 90B أحجام بلاطات 560
متطلبات الأجهزة
للاستدلال (النماذج النصية 1B/3B):
- يحتاج النموذج 3B إلى نحو 7 جيجابايت من ذاكرة VRAM للاستدلال بدقة FP16
- عند تكميمه إلى INT4، يحتاج النموذج 3B إلى نحو 1.8 جيجابايت من VRAM، لذا يتسع على بطاقة RTX 4090 بسعة 24 جيجابايت مع مساحة لدفعة صغيرة
- الموصى به: وحدة معالجة رسومات تدعم CUDA (16 جيجابايت VRAM أو أكثر)؛ الذاكرة العشوائية: 32 جيجابايت على الأقل (64 جيجابايت للنماذج الأكبر)
- مساحة قرص حرة لا تقل عن 50 جيجابايت للنموذج والمتطلبات المرتبطة به
لنماذج الرؤية (11B/90B):
- تتطلب نماذج الرؤية موارد أكبر بكثير؛ ويُنصح بالتكميم (INT4/QLoRA) للنشر المحلي
المعالج/النظام:
- نظام التشغيل: Linux (المفضّل)، أو macOS، أو Windows؛ Python: الإصدار 3.8 أو أحدث؛ CUDA Toolkit: مطلوب لتسريع GPU (11.6 أو أحدث)
أبرز نتائج المعايير
في اختبار MMLU مع تحفيز سلسلة التفكير، تسجل Llama 3.2 90B نتيجة 86.0، متفوقة قليلًا على Claude 3 Haiku وقريبة من GPT-4o-mini.
في MMLU (5-shot)، تسجل Llama 3.2 3B نتيجة 63.4، متفوقة على Gemma 2B IT بنتيجة 57.8. وفي GPQA (0-shot, CoT)، تسجل Llama 3.2 90B نتيجة 46.7، أفضل من Claude 3 Haiku لكنها متأخرة عن GPT-4o-mini.
في اختبار IFEval، تسجل Llama 3.2 3B نتيجة مبهرة بلغت 77.4، متفوقة على Gemma 2B IT (61.9) وPhi-3.5-mini IT (59.2). وفي معيار MGSM متعدد اللغات، تسجل Llama 3.2 90B نتيجة 86.9، وهي نتيجة قوية تُقارن بـ GPT-4o-mini عند 87.0.
كيفية تشغيله محليًا
باستخدام Ollama (الطريقة الأسرع):
للنموذج 3B الأكثر شيوعًا:
ollama run llama3.2:3b
للنموذج 1B (أخف وزنًا):
ollama run llama3.2:1b
مشغلات محلية بديلة:
- LM Studio - توفر واجهة رسومية مع بحث وإدارة مدمجين للنماذج
- Jan - واجهة مبسطة محسّنة للاستخدام الحواري
- GPT4All - تطبيق سطح مكتب مع تنزيل النماذج بنقرة واحدة
- Msty - عميل كامل الميزات مع قوالب مطالبات وإدارة السجل
جميع هذه التطبيقات تتضمن Llama 3.2 في كتالوجات نماذجها الافتراضية وتتعامل مع متغيرات التكميم تلقائيًا.
الإعداد اليدوي (للمتقدمين):
دُرّبت النماذج على ما يصل إلى 9 تريليونات رمز وتدعم طول سياق طويل يبلغ 128k رمزًا. نزّل أوزان BF16 أو الأوزان المكمَّمة من Hugging Face (meta-llama/Llama-3.2-1B، meta-llama/Llama-3.2-3B، إلخ) واستخدم transformers + torch، أو أطرًا متخصصة مثل vLLM لخدمة محسّنة.
أفضل حالات الاستخدام
النماذج النصية فقط (1B/3B):
- حالات الاستخدام على الجهاز مثل التلخيص واتباع التعليمات ومهام إعادة الصياغة التي تعمل محليًا على الطرفية
- إعادة صياغة المطالبات، والاسترجاع المعرفي متعدد اللغات، ومهام التلخيص، واستخدام الأدوات، والمساعدين الذين يعملون محليًا
- مساعدو الكتابة المدعومون بالذكاء الاصطناعي على الهواتف
- أنظمة إدارة المعرفة الشخصية
- المعالجة الفورية على الهواتف والأجهزة اللوحية والأجهزة الذكية
نماذج الرؤية (11B/90B):
- مهام الاستدلال البصري وفهم الصور، متجاوزة نماذج مغلقة مثل Claude 3 Haiku
- تحليل المستندات (المخططات والرسوم البيانية والتقارير المالية)
- وصف الصور والإسناد البصري
- فهم والبحث في المستندات متعددة الوسائط
الأسئلة الشائعة
هل يمكنني استخدام Llama 3.2 تجاريًا؟
تُمنح Llama 3.2 بموجب ترخيص محدود غير حصري وعالمي وغير قابل للتحويل ومعفى من الرسوم يتيح الاستخدام والنسخ والتوزيع والتكرار وإنشاء أعمال مشتقة والتعديلات. وإذا تجاوز المستخدمون النشطون شهريًا 700 مليون، فيلزم اتفاق تجاري منفصل مع Meta قد يتضمن رسومًا أو إتاوات قائمة على الاستخدام.
ما طول السياق المدعوم؟
تدعم جميع نماذج Llama 3.2 طول سياق يبلغ 128K، محافظةً على سعة الرموز الموسّعة التي أُدخلت في Llama 3.1. لاحظ أن النسخ المضبوطة بالتعليمات والمكمَّمة لها طول سياق مخفَّض قدره 8k.
أي حجم نموذج ينبغي أن أختار لجهازي؟
للاستدلال على بطاقات الرسومات الاستهلاكية مثل RTX 4090، يحتاج النموذج 3B إلى 7 جيجابايت بدقة FP16 لكن 1.8 جيجابايت فقط عند تكميمه إلى INT4. اختر 1B لأقصى قدر من التنقل على الهواتف والأجهزة الطرفية؛ واختر 3B لجودة أفضل عندما يتوفر لديك 2 جيجابايت أو أكثر. وللحواسيب المكتبية بذاكرة VRAM بسعة 8 جيجابايت أو أكثر، استخدم النموذج 3B بالدقة الكاملة أو نموذج الرؤية 11B المكمَّم.
هل النماذج متعددة الوسائط مقيَّدة؟
فيما يتعلق بالنماذج متعددة الوسائط، لا تُمنح الحقوق المقررة بموجب اتفاقية ترخيص مجتمع Llama 3.2 إذا كنت فردًا مقيمًا في الاتحاد الأوروبي أو شركة يقع مقرها الرئيسي فيه. ولا ينطبق هذا القيد على المستخدمين النهائيين لمنتج أو خدمة تتضمن هذه النماذج متعددة الوسائط.
المصادر والاعتمادات
المصدر الأصلي: Meta Llama Official Blog & Hugging Face Model Cards