← جميع النماذجفحص النموذج

هل يمكنني تشغيل Nemotron 3 Super 120B-A12B؟

يحتاج Nemotron 3 Super 120B-A12B من NVIDIA إلى نحو 96 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 72.8 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~48 tok/s على Apple M-series Max.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج Nemotron 3 Super 120B-A12B من NVIDIA هو نموذج قائم على مزيج الخبراء (MoE) موجَّه لمن يريدون استدلالاً وبرمجة من الطراز المتقدم على عتادهم الخاص ويملكون الذاكرة الكافية لذلك. ورغم أنه يحمل 120B معاملاً إجمالياً، لا يُنشَّط منها سوى 12B لكل توكن، لذا يعمل أسرع بكثير مما يوحي به حجمه، لكنه يظل بحاجة إلى مساحة تستوعب النموذج كاملاً. وهنا المشكلة: حتى بتكميم 4-bit يصل حجمه إلى نحو 72.8 GB، وتحتاج إلى 96 GB من الذاكرة على الأقل لتحميله. هذا ليس نموذجاً لبطاقة بسعة 8 GB. فبطاقة RTX 4090 بسعة 24 GB لا تستوعبه، وحتى نسخة 2-bit بحجم 50 GB تقريباً تبقى بعيدة المنال. المكان الواقعي لتشغيله هو جهاز Apple Silicon كبير بذاكرة موحَّدة أو خادم بذاكرة نظام وفيرة.

في الاستخدام اليومي يثبت تصميم MoE جدواه. على معالج Apple M Max يمكنك توقّع نحو 48 tok/s، وهو ما يبدو تفاعلياً بحق في الدردشة والاستدلال متعدد الخطوات والمساعدة البرمجية رغم وسم 120B. أما إن دفعته إلى المعالج المركزي مع ذاكرة DDR5 فستنخفض السرعة إلى نحو 7 tok/s، وهي صالحة للأعمال الدُّفعية لا للمحادثة الحيّة. نافذة السياق هائلة عند 1000K توكن، لكن عامِلها كسقف لا كإعداد تتركه على أقصاه. فحتى ملء 128K يرفع إجمالي الذاكرة إلى نحو 129.5 GB بعد احتساب ذاكرة KV المؤقتة، ولذلك على جهاز بسعة 96 GB ستنفد لديك المساحة قبل بلوغ الحد المُعلَن بكثير. أبقِ سياق العمل معتدلاً ما لم تكن لديك ذاكرة فائضة.

مقارنةً بأقرب أقربائه، يجلس Nemotron 3 Super في صحبة لافتة. فنموذج Qwen 3.5 122B-A10B هو نموذج MoE بحجم مماثل يدعم أيضاً الرؤية، وهو ما لا يفعله هذا النموذج، لذا إن كنت تحتاج إلى إدخال الصور فإن ذلك النموذج يتفوّق عموماً. ونموذج Mistral Small 4 119B مماثل في الحجم ومتعدد الوسائط أيضاً. وإن كان عتادك لا يصل إلى هذا الحد، فإن نموذج Nemotron 3 Nano 30B-A3B الأصغر بكثير هو البديل الخفيف من العائلة نفسها، وغالباً ما يكون الخيار العملي على الأجهزة المحدودة. ميزة Super البارزة هي تقديمه استدلالاً من فئة 120B بسرعة من فئة 12B لمن يستطيع استضافته. تحذير واحد: يُطرح بترخيص NVIDIA Open Model، لذا راجع تلك الشروط قبل الاعتماد عليه تجارياً بدلاً من افتراض حرية مفتوحة المصدر بالكامل.

المواصفات

المعاملات120B (12B نشطة)
نافذة السياق1M رمز
المطوِّرNVIDIA
الرخصةNVIDIA Open Model
تاريخ الإصدار2026-03
الأفضل فيمحادثة, استدلال, برمجة

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.3550.3 GB96 GBفقدان ملحوظ
Q4_K_Mموصى به4.8572.8 GB96 GBموصى به
Q5_K_M5.6584.8 GB128 GBعالية
Q8_08.5127.5 GB192 GBشبه أصلية
F1616240.0 GB256 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~1.8 GB~74.6 GB
8K رمز~3.5 GB~76.3 GB
32K رمز~14.2 GB~87.0 GB
128K رمز~56.7 GB~129.5 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/sلا يتسع في VRAM
NVIDIA RTX 4090 24GB1008 GB/sلا يتسع في VRAM
Apple M-series (base)100 GB/s~12 tok/s
Apple M-series Pro270 GB/s~32 tok/s
Apple M-series Max410 GB/s~48 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run nemotron-3-super:120b

الأسئلة الشائعة

متطلبات تشغيل Nemotron 3 Super 120B-A12B — هل يستطيع جهازي تشغيله؟