هل يمكنني تشغيل Gemma 4 12B؟
يحتاج Gemma 4 12B من Google إلى نحو 12 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 7.3 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~42 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Gemma 4 12B نموذج كثيف بحجم 12B يدعم الرؤية، مخصّص للمحادثة والبرمجة والاستدلال، وموجّه لمن يريد مساعدًا محليًا واحدًا قادرًا يقرأ الصور أيضًا. عند التكميم بدقة 4-bit يصل حجمه إلى نحو 7.3 GB، فيتّسع على بطاقة بسعة 12 GB مثل RTX 3060 مع مساحة كافية للسياق، ويستقرّ بأريحية في الذاكرة الموحّدة على أجهزة Apple Silicon Mac. يحتاج النموذج إلى نحو 12 GB من RAM كحدّ أدنى للتحميل. وإن كنت محدود الموارد، فإن نسخة 2-bit تنخفض إلى ما يقارب 5 GB، لكنك تضحّي بالجودة مقابل هذا التوفير.
في الاستخدام اليومي يولّد النصّ بسرعة تبلغ نحو 42 tok/s على RTX 3060، وهي سرعة كافية لتقرأ مع تدفّق الإجابة، ونحو 48 tok/s على معالج M-series Max. وتدفعه بطاقة RTX 4090 إلى ما يتجاوز 100. نافذة السياق البالغة 256K سخيّة، لكن تعامل معها كهامش إضافي لا كإعداد افتراضي. فحتى عند سياق 128K يرتفع مجموع النموذج مع ذاكرة KV cache إلى نحو 27.4 GB إجمالًا، أي أبعد بكثير من سعة بطاقة واحدة بحجم 12 GB، ما يعني أنك ستلجأ إلى ذاكرة النظام أو ستتباطأ بشدّة. أبقِ سياق العمل عند بضعة آلاف من التوكنات على العتاد الاستهلاكي.
مقارنةً بنموذج Gemma 3 4B الأخفّ، يتفوّق إصدار 12B عمومًا في الاستدلال متعدّد الخطوات والبرمجة، وهذه هي المقايضة التي تدفع ثمنها من الذاكرة الإضافية؛ أما Gemma 3 4B فهو الخيار إن كنت محدود الموارد أو تحتاج إلى المحادثة والرؤية فقط. الميزة اللافتة هنا أن الرؤية والاستدلال النصّي القوي يأتيان معًا في نموذج واحد لا يزال يعمل على بطاقة GPU متوسطة الفئة. كما أن الرخصة نظيفة: رخصة Apache 2.0 تعني أنه يمكنك استخدامه تجاريًا وفي بيئة الإنتاج دون قيود خاصة بمزوّد معيّن.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.0 GB | 8 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 7.3 GB | 12 GB | موصى به |
| Q5_K_M | 5.65 | 8.5 GB | 16 GB | عالية |
| Q8_0 | 8.5 | 12.8 GB | 24 GB | شبه أصلية |
| F16 | 16 | 24.0 GB | 32 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.6 GB | ~7.9 GB |
| 8K رمز | ~1.3 GB | ~8.6 GB |
| 32K رمز | ~5.0 GB | ~12.3 GB |
| 128K رمز | ~20.1 GB | ~27.4 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~42 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~118 tok/s |
| Apple M-series (base) | 100 GB/s | ~12 tok/s |
| Apple M-series Pro | 270 GB/s | ~32 tok/s |
| Apple M-series Max | 410 GB/s | ~48 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run gemma4:12b