هل يمكنني تشغيل Granite 4.0 H Small؟
يحتاج Granite 4.0 H Small من IBM إلى نحو 32 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 19.4 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~64 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Granite 4.0 H Small من IBM يعتمد على بنية mixture-of-experts: لديه 32B معامل على الورق، لكن نحو 9B فقط نشطة لكل توكن. هذا الانقسام هو جوهر القصة كلها. يعمل بسرعة مقارنةً بحجمه لأن كل توكن يمر على جزء صغير من الأوزان، لكنك مع ذلك مضطر إلى تحميل النموذج كاملاً في الذاكرة، فخطّط بناءً على الحد الأدنى البالغ 32 GB لا بناءً على عدد المعاملات النشطة. عند تكميم 4-bit يصل حجمه إلى نحو 19.4 GB، وهو ما يستبعد تماماً بطاقة بسعة 12 GB مثل RTX 3060 ويوجّهك بدلاً من ذلك إلى بطاقة بسعة 24 GB أو جهاز Apple Silicon Mac بذاكرة موحّدة وفيرة. النموذج موجّه لأعمال الدردشة والبرمجة، لا للتجريب العابر على حاسوب محمول.
على بطاقة RTX 4090 يبلغ أداؤه نحو 157 توكن في الثانية، وهو أسرع بكثير من سرعة القراءة ويجعله مريحاً لجلسات البرمجة التفاعلية. على شريحة M-series Max تتوقع نحو 64 tok/s، وهو لا يزال مريحاً، أما المعالجة على CPU وحده مع ذاكرة DDR5 فتنخفض إلى نحو 9 tok/s، صالحة لمهام الدفعات لكن ليس للدردشة الحية. سياق الـ 128K حقيقي، لكنه مكلف: إذا ملأته يرتفع إجمالي الذاكرة إلى نحو 50.7 GB، لذا على بطاقة بسعة 24 GB لا يمكنك فعلياً العمل قرب الحد الأقصى. أبقِ السياق العملي معتدلاً ما لم يكن لديك جهاز Mac بذاكرة 64 GB يمكنك تخصيصه.
بمقارنته مع Qwen 3 32B، وهو نموذج dense بحجم إجمالي مماثل، يبدو Granite عموماً أخف على العتاد بفضل تصميم MoE، رغم أن Qwen 3 يميل إلى التفوّق في مهام الاستدلال الأثقل لأنه يفعّل كل معاملاته مع كل توكن. إن أردت شيئاً أصغر وأبسط، فإن نموذج Granite 3.3 8B الـ dense هو الخيار الأسهل على البطاقات المتواضعة. أبرز ما يميّز Granite 4.0 H Small أنه نموذج من فئة 32B سريع فعلاً ويمكنك استضافته ذاتياً، وهو يُطرح بترخيص Apache 2.0، فأنت حرّ في استخدامه تجارياً دون أي قلق بشأن الترخيص.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.4 GB | 24 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 19.4 GB | 32 GB | موصى به |
| Q5_K_M | 5.65 | 22.6 GB | 32 GB | عالية |
| Q8_0 | 8.5 | 34.0 GB | 48 GB | شبه أصلية |
| F16 | 16 | 64.0 GB | 96 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~1.0 GB | ~20.4 GB |
| 8K رمز | ~2.0 GB | ~21.4 GB |
| 32K رمز | ~7.8 GB | ~27.2 GB |
| 128K رمز | ~31.3 GB | ~50.7 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~157 tok/s |
| Apple M-series (base) | 100 GB/s | ~16 tok/s |
| Apple M-series Pro | 270 GB/s | ~42 tok/s |
| Apple M-series Max | 410 GB/s | ~64 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~9 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run granite4:32b-a9b-h