هل يمكنني تشغيل Granite 3.3 8B؟
يحتاج Granite 3.3 8B من IBM إلى نحو 8 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 5.0 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~62 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Granite 3.3 8B هو إسهام IBM في فئة الدردشة المزدحمة بحجم 8B، وهو موجَّه تحديدًا لمن يريد مساعدًا محليًا موثوقًا يمكنه فعليًا الاعتماد عليه في الإنتاج. بـ 8.2 مليار معامل، يصل حجمه إلى نحو 5 GB عند التكميم 4-bit، فيتسع على بطاقة رسومات بسعة 8 GB، ويعمل ضمن الذاكرة الموحَّدة على أي جهاز Mac بمعالج Apple Silicon، ويعني الحد الأدنى البالغ 8 GB من الذاكرة أنه في متناول أجهزة عادية إلى حد بعيد. وإن احتجت إلى حجم أصغر، فإن بناء 2-bit ينزل إلى نحو 3.4 GB، لكنك تضحّي بالجودة مقابل ذلك.
في الاستخدام اليومي، يبدو سريعًا وثابتًا في الدردشة. على بطاقة RTX 3060 12 GB ستحصل على نحو 62 tok/s عند 4-bit، أسرع بمريح من سرعة قراءتك، بينما ترفع RTX 4090 ذلك إلى نحو 172 tok/s. ويستقر معالج M-series Max قرب 70 tok/s، في حين أن التشغيل على المعالج وحده مع ذاكرة DDR5 أقرب إلى 10 tok/s ويُفضَّل حجزه للأعمال الخلفية التي تحتمل الانتظار. ونافذة السياق 128K حقيقية، لكن عاملها كسقف: ملؤها بالكامل يرفع إجمالي الذاكرة إلى نحو 22 GB، لذا على بطاقة بسعة 8 GB أبقِ سياق العمل عند بضعة آلاف من الرموز.
بمقارنته بأقرانه، يبقى Granite 3.3 8B النموذج العملي الكادح لا النجم اللامع. فنموذج Qwen 3 8B، المماثل له في الحجم تقريبًا، يتفوق عمومًا في المطالبات التي تتطلب استدلالًا كثيفًا وخطوات متعددة، وإن احتجت إلى قوة برمجية حقيقية فإن Granite 4.0 H Small الأكبر بكثير هو الخيار الأنسب. وما يقدّمه هذا النموذج بدلًا من ذلك هو وضوح الترخيص: فهو بترخيص Apache 2.0، أي يمكنك استخدامه تجاريًا وفي الإنتاج دون قيود خاصة بالمزوّد. وبالنسبة إلى شركة تريد نموذج دردشة صغيرًا ويمكن التنبؤ بسلوكه وتنشره دون تردد قانوني، فإن هذا الانفتاح هو الجاذبية الحقيقية.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 5.0 GB | 8 GB | موصى به |
| Q5_K_M | 5.65 | 5.8 GB | 12 GB | عالية |
| Q8_0 | 8.5 | 8.7 GB | 16 GB | شبه أصلية |
| F16 | 16 | 16.4 GB | 24 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.5 GB | ~5.5 GB |
| 8K رمز | ~1.1 GB | ~6.1 GB |
| 32K رمز | ~4.2 GB | ~9.2 GB |
| 128K رمز | ~17.0 GB | ~22.0 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~62 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~172 tok/s |
| Apple M-series (base) | 100 GB/s | ~17 tok/s |
| Apple M-series Pro | 270 GB/s | ~46 tok/s |
| Apple M-series Max | 410 GB/s | ~70 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~10 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run granite3.3