هل يمكنني تشغيل Nemotron 3 Super 120B-A12B؟
يحتاج Nemotron 3 Super 120B-A12B من NVIDIA إلى نحو 96 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 72.8 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~48 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Nemotron 3 Super 120B-A12B من NVIDIA هو نموذج قائم على مزيج الخبراء (MoE) موجَّه لمن يريدون استدلالاً وبرمجة من الطراز المتقدم على عتادهم الخاص ويملكون الذاكرة الكافية لذلك. ورغم أنه يحمل 120B معاملاً إجمالياً، لا يُنشَّط منها سوى 12B لكل توكن، لذا يعمل أسرع بكثير مما يوحي به حجمه، لكنه يظل بحاجة إلى مساحة تستوعب النموذج كاملاً. وهنا المشكلة: حتى بتكميم 4-bit يصل حجمه إلى نحو 72.8 GB، وتحتاج إلى 96 GB من الذاكرة على الأقل لتحميله. هذا ليس نموذجاً لبطاقة بسعة 8 GB. فبطاقة RTX 4090 بسعة 24 GB لا تستوعبه، وحتى نسخة 2-bit بحجم 50 GB تقريباً تبقى بعيدة المنال. المكان الواقعي لتشغيله هو جهاز Apple Silicon كبير بذاكرة موحَّدة أو خادم بذاكرة نظام وفيرة.
في الاستخدام اليومي يثبت تصميم MoE جدواه. على معالج Apple M Max يمكنك توقّع نحو 48 tok/s، وهو ما يبدو تفاعلياً بحق في الدردشة والاستدلال متعدد الخطوات والمساعدة البرمجية رغم وسم 120B. أما إن دفعته إلى المعالج المركزي مع ذاكرة DDR5 فستنخفض السرعة إلى نحو 7 tok/s، وهي صالحة للأعمال الدُّفعية لا للمحادثة الحيّة. نافذة السياق هائلة عند 1000K توكن، لكن عامِلها كسقف لا كإعداد تتركه على أقصاه. فحتى ملء 128K يرفع إجمالي الذاكرة إلى نحو 129.5 GB بعد احتساب ذاكرة KV المؤقتة، ولذلك على جهاز بسعة 96 GB ستنفد لديك المساحة قبل بلوغ الحد المُعلَن بكثير. أبقِ سياق العمل معتدلاً ما لم تكن لديك ذاكرة فائضة.
مقارنةً بأقرب أقربائه، يجلس Nemotron 3 Super في صحبة لافتة. فنموذج Qwen 3.5 122B-A10B هو نموذج MoE بحجم مماثل يدعم أيضاً الرؤية، وهو ما لا يفعله هذا النموذج، لذا إن كنت تحتاج إلى إدخال الصور فإن ذلك النموذج يتفوّق عموماً. ونموذج Mistral Small 4 119B مماثل في الحجم ومتعدد الوسائط أيضاً. وإن كان عتادك لا يصل إلى هذا الحد، فإن نموذج Nemotron 3 Nano 30B-A3B الأصغر بكثير هو البديل الخفيف من العائلة نفسها، وغالباً ما يكون الخيار العملي على الأجهزة المحدودة. ميزة Super البارزة هي تقديمه استدلالاً من فئة 120B بسرعة من فئة 12B لمن يستطيع استضافته. تحذير واحد: يُطرح بترخيص NVIDIA Open Model، لذا راجع تلك الشروط قبل الاعتماد عليه تجارياً بدلاً من افتراض حرية مفتوحة المصدر بالكامل.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 50.3 GB | 96 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 72.8 GB | 96 GB | موصى به |
| Q5_K_M | 5.65 | 84.8 GB | 128 GB | عالية |
| Q8_0 | 8.5 | 127.5 GB | 192 GB | شبه أصلية |
| F16 | 16 | 240.0 GB | 256 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~1.8 GB | ~74.6 GB |
| 8K رمز | ~3.5 GB | ~76.3 GB |
| 32K رمز | ~14.2 GB | ~87.0 GB |
| 128K رمز | ~56.7 GB | ~129.5 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | لا يتسع في VRAM |
| Apple M-series (base) | 100 GB/s | ~12 tok/s |
| Apple M-series Pro | 270 GB/s | ~32 tok/s |
| Apple M-series Max | 410 GB/s | ~48 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run nemotron-3-super:120b