هل يمكنني تشغيل Gemma 3 27B؟
يحتاج Gemma 3 27B من Google إلى نحو 24 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 16.6 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~21 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Gemma 3 27B هو النموذج الذي تلجأ إليه حين يبدو لك مساعد من فئة 8B أنحف من اللازم وتملك ذاكرة كافية تحت تصرفك. إنه نموذج محادثة ورؤية بحجم 27.4B من Google، أي أنه يقرأ الصور كما يقرأ النص، وهذه القدرة هي السبب الرئيسي لاختياره بدلاً من نموذج نصي فقط بالحجم نفسه. عند تكميم 4-bit يصل حجمه إلى نحو 16.6 GB، لذا فإن بطاقة بسعة 12 GB مثل RTX 3060 لن تستوعبه ببساطة، وستحتاج إلى 24 GB على الأقل من الذاكرة أو الذاكرة الموحّدة قبل أن يعمل بأريحية. بطاقة RTX 4090 بسعة 24 GB أو جهاز Mac من سلسلة M بذاكرة موحّدة وفيرة هما الموطن الطبيعي له.
في الاستخدام اليومي يبدو محاوراً أكثر رسوخاً بوضوح من النماذج الصغيرة، مع كون الجانب متعدد الوسائط مفيداً حقاً لوصف لقطات الشاشة والصور والاستدلال عليها. على بطاقة 4090 بتكميم 4-bit يمكنك توقّع نحو 52 tok/s، وهو ما يتدفّق أسرع من قراءتك؛ بينما يقترب جهاز M Max Mac من 21 tok/s ولا يزال قابلاً للاستخدام تماماً، في حين يهبط التشغيل على المعالج وحده مع ذاكرة DDR5 إلى نحو 3 tok/s ولا يصلح فعلياً إلا للمهام الدفعية. سياق 128K حقيقي لكنه مكلف هنا: ملؤه بالكامل يرفع إجمالي الذاكرة إلى نحو 45.8 GB، وهو أبعد بكثير مما يستوعبه جهاز واحد بسعة 24 GB، لذا أبقِ سياق العمل معتدلاً ما لم يكن لديك هامش إضافي.
ضمن عائلته هو الوزن الثقيل، إذ يبقى Gemma 3 4B الخيار الأخف حين تكون الذاكرة ضيّقة وتريد قدرة الرؤية رغم ذلك. المقارنة الأكثر إثارة للاهتمام هي مع Qwen 3.5 27B، وهو نموذج بحجم شبه مطابق يضيف نقاط قوة مخصّصة في الاستدلال والبرمجة؛ ففي مهام الرياضيات أو الأكواد المنظّمة يتفوّق عادةً على Gemma، لذا اختر Gemma 3 27B للمحادثة المتينة وفهم الصور أكثر من الاستدلال الصعب. ميزته البارزة هي ذلك التوازن بين الرؤية والمحادثة بحجم يمكن إدارته على بطاقة GPU واحدة. تنبيه واحد: رخصة Gemma مفتوحة الأوزان لا مفتوحة المصدر، فاقرأ شروط Google قبل شحنه في منتج تجاري.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.5 GB | 16 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 16.6 GB | 24 GB | موصى به |
| Q5_K_M | 5.65 | 19.4 GB | 32 GB | عالية |
| Q8_0 | 8.5 | 29.1 GB | 48 GB | شبه أصلية |
| F16 | 16 | 54.8 GB | 96 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.9 GB | ~17.5 GB |
| 8K رمز | ~1.8 GB | ~18.4 GB |
| 32K رمز | ~7.3 GB | ~23.9 GB |
| 128K رمز | ~29.2 GB | ~45.8 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run gemma3:27b