ذكاء اصطناعي محلي · Google AI Developers Blog & Official Documentation
Gemma 2: دليل كامل للنماذج مفتوحة الأوزان
الصورة: Growtika على Unsplash
Gemma 2 هي عائلة مايكروسوفت... عذرًا، عائلة جوجل من نماذج اللغة الكبيرة القابلة للتنزيل مجانًا، والمتاحة بأحجام 2B و9B و27B معامل. وقد قُطّرت من Gemini ودُرّبت بالتقطير المعرفي، وتقدم هذه النماذج أداءً تنافسيًا مع نماذج أكبر منها بمرات عديدة مع كونها تعمل بكفاءة على أجهزة استهلاكية. وهي متاحة بموجب ترخيص متسامح ومتوافقة مع Ollama وLM Studio وأدوات الاستدلال المحلية الأخرى.
ما هي Gemma 2؟
Gemma 2 هي عائلة جوجل من نماذج اللغة الكبيرة المفتوحة، وتقدم أحجامًا بمعاملات 2B و9B و27B. وتقدم هذه النماذج المفتوحة الخفيفة والمتطورة جدًا أفضل أداء في فئتها، بل تقدم بدائل تنافسية لنماذج أكبر منها بمرتين إلى ثلاث مرات.
Gemma 2 2B هو نموذج لغوي مُدمج مفتوح الأوزان طورته جوجل للنشر على الأجهزة الطرفية والمحمولة محدودة الموارد، وقُطّر من معماريات Gemini الأكبر. وGemma 2 متاحة بموجب ترخيص Gemma الملائم تجاريًا، ما يمنح المطورين والباحثين القدرة على مشاركة ابتكاراتهم وتسويقها تجاريًا.
الأحجام والمتغيرات المتاحة
Gemma 2 متاحة بأحجام بمعاملات 2B و9B و27B. ويأتي كل حجم بنسختين:
- النموذج الأساسي: مدرب مسبقًا، ومناسب للضبط الدقيق والبحث
- المضبوط بالتعليمات (IT): محسّن للمهام الحوارية وتفاعلات المستخدمين
المواصفات التقنية
- طول السياق: تدعم جميع النماذج طول تسلسل يبلغ 8,192 رمزًا.
- حجم المفردات: 256,128 رمزًا (أكبر بكثير من النماذج المنافسة)
- المعمارية: محوّل كثيف بتصميم مُفكِّك فقط
- بيانات التدريب: تألفت مجموعة تدريب النموذج 9B من 8 تريليونات رمز، معظمها من مستندات الويب والشيفرة والمحتوى الرياضي.
متطلبات الأجهزة
متطلبات الذاكرة (الدقة الكاملة FP16)
Gemma 2 2B: 5.76 جيجابايت VRAM عند 1K رمز، و6.16 جيجابايت VRAM عند 8K رمز. وتتعامل معه بطاقة RTX 4090 واحدة أو ما يعادلها بارتياح.
Gemma 2 9B: يتطلب عادة 18-20 جيجابايت VRAM للدقة الكاملة. ويمكن لوحدات رسومات مثل NVIDIA A100 40GB أو RTX 4090 بسعة 24 جيجابايت أن تضبط Gemma 2 2B ضبطًا دقيقًا بأحجام دفعات مخفَّضة.
Gemma 2 27B: بالدقة الكاملة (FP16) مع 8,192 رمزًا، يتطلب 61.44 جيجابايت VRAM، وهو مناسب لـ1x NVIDIA A100 80GB، أو 3x RTX 4090 24GB، أو 1x Apple M3 Max 128GB.
خيارات التكميم
- تكميم INT8: يقلل الذاكرة إلى النصف (تقريبًا)
- تكميم INT4: يقللها أكثر إلى ربع الحجم الأصلي، ويتيح الاستدلال على الحواسيب المحمولة
- صيغة GGUF: محسّنة للاستدلال على المعالج مع Ollama وأدوات مشابهة
يمكن تشغيل Gemma 2B بتكميم Q4 (نحو 1.4 جيجابايت) على Raspberry Pi 4 بذاكرة 4 جيجابايت، محققًا نحو 3-5 رموز في الثانية.
أبرز نتائج المعايير
تُظهر نماذج Gemma 2 أداءً استثنائيًا نسبةً إلى عدد معاملاتها عبر أطر تقييم متعددة.
LMSYS Chatbot Arena (التقييم البشري)
حصل Gemma 27B (Elo 1218) على مرتبة أعلى من Llama 3 70B (Elo 1206)، وGemma 9B (Elo 1187) مشابه لـ GPT-4-0314 (Elo 1186)، وGemma 2.6B (Elo 1126) على مرتبة أعلى من GPT-3.5-Turbo-0613 (Elo 1116).
المعايير الأكاديمية
في معيار MMLU، تسجل Gemma 2 2B نسبة 52.2%، وGemma 2 9B نسبة 71.3%، وGemma 2 27B نسبة 75.2%. نتائج إضافية:
- GSM8K (الرياضيات): Gemma 2 9B: 68.6%، Gemma 2 27B: 74.0%
- HumanEval (الشيفرة): Gemma 2 9B: 68.2%، Gemma 2 27B: 74.9%
- BBH (الاستدلال): Gemma 2 9B: 68.2%، Gemma 2 27B: 74.9%
الإنجاز الرئيسي
صعد النموذج 27B سريعًا في لوحة صدارة LMSYS Chatbot Arena، متجاوزًا حتى نماذج شهيرة يزيد حجمها على ضعفه في المحادثات الجذابة الواقعية، بينما يتفوق نموذج Gemma 2 2B على جميع نماذج GPT-3.5 في Chatbot Arena بحجم يمكن تشغيله على الأجهزة الطرفية.
كيفية تشغيلها محليًا
باستخدام Ollama (الطريقة الأسهل)
Gemma 2 متوافقة مع أطر الذكاء الاصطناعي الرئيسية بما فيها Hugging Face Transformers وJAX وPyTorch وTensorFlow عبر Keras 3.0 وvLLM وGemma.cpp وLlama.cpp وOllama.
التثبيت والاستخدام:
- ثبّت Ollama من ollama.com
- شغّل أحد هذه الأوامر:
- 2B معامل: ollama run gemma2:2b
- 9B معامل: ollama run gemma2
- 27B معامل: ollama run gemma2:27b
أدوات بديلة
تدعم منصات الاستدلال المحلي الشهيرة الأخرى Gemma 2 أيضًا:
- LM Studio: نزّلها من lmstudio.ai، وتوفر واجهة رسومية لإدارة النماذج
- Jan: بديل مفتوح المصدر بوظائف مشابهة
- GPT4All: واجهة صديقة للمبتدئين مع نماذج مُهيأة مسبقًا
- Msty: تطبيق سطح مكتب متعدد المنصات للاستدلال المحلي للنماذج اللغوية
تتيح لك جميع هذه الأدوات تنزيل نسخ مكمَّمة من Gemma 2 من كتالوجات نماذجها المدمجة وتشغيلها دون اتصال.
أفضل حالات الاستخدام
Gemma 2 9B مناسبة لإنشاء المحتوى مثل الشعر وكتابة النصوص الإعلانية وتوليد الشيفرة، والمتغيرات المضبوطة بالتعليمات فعّالة بشكل خاص للوكلاء الحواريين وروبوتات الدردشة، وتدعم مهام مثل الأسئلة والأجوبة والتلخيص.
التطبيقات المثالية:
- الأجهزة الطرفية والمحمولة: يعمل النموذج 2B بكفاءة على الهواتف والأنظمة المدمجة
- توليد الشيفرة والمساعدة البرمجية: أداء قوي في HumanEval ومعايير البرمجة
- تلخيص المستندات: تلخيص تجريدي واستخلاصي عالي الجودة
- روبوتات دردشة خدمة العملاء: تتفوق المتغيرات المضبوطة بالتعليمات في الحوار الموجّه للمستخدمين
- النشر المحلي القائم على الخصوصية أولًا: تحكم كامل في البيانات دون استدعاءات واجهات برمجية خارجية
- الأدوات التعليمية: أنظمة أسئلة وأجوبة للمعلم/الطالب وتطبيقات التدريس
- استدلال فعّال من حيث التكلفة: النشر على وحدة رسومات واحدة أو المعالج يقلل تكاليف التشغيل
الأسئلة الشائعة
هل يمكن تشغيل Gemma 2 بالكامل على حاسوبي المحمول دون وحدة رسومات؟
يجعل الحجم الصغير نسبيًا لـ Gemma 2 نشرها ممكنًا في بيئات محدودة الموارد مثل الحاسوب المحمول أو المكتبي أو بنيتك السحابية الخاصة. ويمكن تشغيل النموذج 2B على المعالج، لكن السرعات ستكون بطيئة (بضعة رموز في الثانية). ويقلل التكميم إلى صيغة INT4 متطلبات الذاكرة أكثر.
ما الفرق بين نماذج Gemma 2 الأساسية والمضبوطة بالتعليمات؟
النماذج الأساسية مدربة مسبقًا ومحسّنة للضبط الدقيق على مهام مخصصة. أما المتغيرات المضبوطة بالتعليمات (IT) فتخضع لتدريب إضافي لاتباع تعليمات المستخدم والانخراط في الحوار، مما يجعلها جاهزة للاستخدام فورًا كروبوتات دردشة دون مزيد من التدريب.
هل Gemma 2 مفتوحة المصدر حقًا؟
نماذج Gemma "مفتوحة الأوزان" وليست مفتوحة المصدر بالكامل - فالأوزان متاحة بحرية لكن بيانات التدريب والشيفرة ليست كذلك. ولا يزال الترخيص المتسامح يتيح الاستخدام التجاري وإعادة توزيع أوزان النموذج.
كيف تقارَن Gemma 2 بـ Llama 3؟
يقدم نموذج 9B من Gemma 2 أداءً رائدًا في فئته، متفوقًا على Llama 3 8B وغيره من النماذج المفتوحة في فئة حجمه. ويحقق المتغير 27B أداءً تنافسيًا مع نماذج Llama 3 الأكبر بكثير رغم كونه أصغر.
المصادر والاعتمادات
المصدر الأصلي: Google AI Developers Blog & Official Documentation