← جميع النماذجفحص النموذج

هل يمكنني تشغيل Gemma 3 12B؟

يحتاج Gemma 3 12B من Google إلى نحو 12 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 7.4 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~41 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

Gemma 3 12B هو نموذج Google متوسط الحجم مفتوح الأوزان، ويحتل موقعاً مفيداً لمن يريد قدرة أكبر من نماذج الدردشة المعتادة بحجم 7-8B دون الانتقال إلى ما يتطلب محطة عمل. عند تكميم 4-bit يبلغ حجمه نحو 7.4 GB، وهو ما يلائم بطاقة بسعة 12 GB مثل RTX 3060 مع هامش بسيط، ويعمل بسلاسة في الذاكرة الموحّدة على أجهزة Apple Silicon Mac بسعة 16 GB فأكثر. الحد الأدنى لتحميله أصلاً هو 12 GB من الـ RAM. كما أنه يتعامل مع الرؤية، فيمكنك تغذيته بالصور إلى جانب النص، وهو ما تعجز عنه معظم النماذج بهذا الحجم.

في الاستخدام اليومي يبدو سريع الاستجابة على العتاد الاستهلاكي. على RTX 3060 12GB تحصل على نحو 41 tok/s عند 4-bit، أسرع مما تقرأ، وترفع شريحة Apple M Max ذلك إلى نحو 47 tok/s. أما بطاقة 4090 فستنطلق بنحو 116 tok/s إن توفرت لديك. نافذة السياق 128K هي المأخذ: إنها موجودة فعلاً، لكن ملأها مكلف. عند 128K الكاملة يحتاج النموذج مع ذاكرة KV cache إلى نحو 27.7 GB إجمالاً، أي أبعد بكثير مما تتسع له بطاقة بسعة 12 GB، لذا أبقِ سياق العمل متواضعاً ما لم تكن لديك بطاقة GPU بسعة 24 GB أو قدر وافر من الذاكرة الموحّدة.

مقابل Mistral Nemo 12B، البديل الواضح بالحجم نفسه، يتفوق Gemma 3 12B عموماً في اتباع التعليمات والعمل متعدد الوسائط لأن Nemo نصي فقط، وإن كان Nemo يميل لأن يكون الخيار الأخف في دردشة السياق الطويل البحتة. وإن أردت البقاء أصغر، فإن Gemma 3 4B يخفّض البصمة مع الإبقاء على الرؤية. ميزة Gemma 3 12B البارزة هي كونه نموذج رؤية ودردشة قادراً يعمل مع ذلك على بطاقة GPU واحدة متوسطة الفئة. تنبيه واحد: يأتي بترخيص Gemma من Google، وهو مفتوح الأوزان لكنه يحمل شروطاً خاصة بالمزوّد، فاقرأها قبل أي نشر تجاري بدلاً من افتراض أنه مفتوح المصدر بالكامل.

المواصفات

المعاملات12.2B
نافذة السياق128K رمز
المطوِّرGoogle
الرخصةGemma
تاريخ الإصدار2025-03
الأفضل فيمحادثة, رؤية

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.355.1 GB8 GBفقدان ملحوظ
Q4_K_Mموصى به4.857.4 GB12 GBموصى به
Q5_K_M5.658.6 GB16 GBعالية
Q8_08.513.0 GB24 GBشبه أصلية
F161624.4 GB32 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.6 GB~8.0 GB
8K رمز~1.3 GB~8.7 GB
32K رمز~5.1 GB~12.5 GB
128K رمز~20.3 GB~27.7 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~41 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~116 tok/s
Apple M-series (base)100 GB/s~11 tok/s
Apple M-series Pro270 GB/s~31 tok/s
Apple M-series Max410 GB/s~47 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run gemma3:12b

الأسئلة الشائعة