← جميع النماذجفحص النموذج

هل يمكنني تشغيل Gemma 4 E4B؟

يحتاج Gemma 4 E4B من Google إلى نحو 8 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 4.9 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~112 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

Gemma 4 E4B هو نموذج Google الصغير القائم على مزيج الخبراء (MoE)، وهو خيار مناسب إذا أردت مساعدًا محليًا يقرأ الصور أيضًا. الحيلة في بنية MoE أن نحو 4.5B فقط من معاملاته البالغة 8B تُفعَّل لكل رمز، فيعمل بسرعة نموذج أصغر بكثير مع حاجته إلى مساحة تكفي النموذج كاملًا في الذاكرة. بدقة 4-bit يبلغ حجمه نحو 4.9 GB، وهو ما يلائم بطاقة بسعة 12 GB مثل RTX 3060 مع هامش وافر، ويستقر بسهولة ضمن الذاكرة الموحدة على جهاز Apple Silicon Mac بسعة 8 GB. خطّط للنموذج الكامل، لا للشريحة المفعَّلة فقط.

في الاستخدام اليومي يبدو سريعًا. على RTX 3060 يمكنك توقّع نحو 112 tok/s بدقة 4-bit، أما البطاقات الراقية مثل RTX 4090 فتتجاوز 300، أسرع مما تستطيع قراءته على الإطلاق. على Apple Silicon يقترب M-Max من 128 tok/s، وحتى المعالج المركزي على ذاكرة DDR5 يحقق نحو 19 tok/s إن كنت صبورًا. نافذة السياق البالغة 128K حقيقية لكنها مكلفة: املأها وترتفع الذاكرة الكلية إلى نحو 21.7 GB، أي أبعد بكثير مما توحي به الأوزان وحدها. أبقِ سياق العمل عند بضعة آلاف من الرموز على الأجهزة الأصغر وستبقى مرتاحًا.

بالمقارنة مع Gemma 3 4B، الشقيق الأخف في العائلة، يميل E4B إلى منحك مخرجات أقوى مع الحفاظ على بصمة مفعَّلة صغيرة مماثلة، وكلاهما يدعم الرؤية، فهو الخيار الافتراضي الأفضل ما لم تكن شحيح الذاكرة فعلًا. ميزته البارزة هي ذلك التوازن بين السرعة والجودة في بنية MoE: محادثة وفهم للصور بزمن استجابة نموذج صغير. أما الترخيص فهو الجزء السهل. يعني Apache 2.0 أنه يمكنك استخدامه بحرية، بما في ذلك تجاريًا وفي بيئة الإنتاج، دون أي قيود خاصة بالمزوّد. وهذا يجعله واحدًا من أبسط النماذج المحلية لإطلاق منتج فعلي عليه.

المواصفات

المعاملات8B (4.5B نشطة)
نافذة السياق128K رمز
المطوِّرGoogle
الرخصةApache 2.0
تاريخ الإصدار2026-04
الأفضل فيمحادثة, رؤية

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.353.4 GB6 GBفقدان ملحوظ
Q4_K_Mموصى به4.854.9 GB8 GBموصى به
Q5_K_M5.655.7 GB12 GBعالية
Q8_08.58.5 GB16 GBشبه أصلية
F161616.0 GB24 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.5 GB~5.4 GB
8K رمز~1.0 GB~5.9 GB
32K رمز~4.2 GB~9.1 GB
128K رمز~16.8 GB~21.7 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~112 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~314 tok/s
Apple M-series (base)100 GB/s~31 tok/s
Apple M-series Pro270 GB/s~84 tok/s
Apple M-series Max410 GB/s~128 tok/s
CPU only (dual-channel DDR5)60 GB/s~19 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run gemma4:e4b

الأسئلة الشائعة