← جميع النماذجفحص النموذج

هل يمكنني تشغيل Nemotron 3 Nano 30B-A3B؟

يحتاج Nemotron 3 Nano 30B-A3B من NVIDIA إلى نحو 32 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 19.2 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~160 tok/s على Apple M-series Max.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

Nemotron 3 Nano هو نموذج من نوع mixture-of-experts من NVIDIA موجَّه لمن يريد محادثة واستدلالاً وبرمجة بقوة عالية على جهاز محلي دون تحمّل التكلفة الكاملة لنموذج كثيف. الحيلة كامنة في الاسم: فهو يحمل 31.6B معاملاً إجمالاً، لكنه لا يُفعِّل سوى نحو 3.6B منها لكل رمز، فيولّد بسرعة نموذج صغير بينما يفكّر بقدرة نموذج أكبر بكثير. الفخ الذي يكتشفه كل قادم جديد إلى MoE بالطريقة الصعبة هو أنك لا تزال مضطرًا إلى تحميل النموذج بأكمله. عند تكميم 4-bit يبلغ حجم الأوزان نحو 19 GB، وتحتاج إلى 32 GB من RAM على الأقل، وهو ما يستبعد كليًا بطاقة بسعة 12 GB مثل RTX 3060.

في الاستخدام اليومي تظهر حيلة المعاملات المُفعَّلة بوضوح. على RTX 4090 يتدفق بنحو 393 tok/s، وهي سرعة هائلة لنموذج بهذه القدرة، وحتى جهاز Apple Silicon M Max يبقى قرب 160 tok/s على الذاكرة الموحَّدة. أما التشغيل على المعالج وحده مع DDR5 فينخفض إلى نحو 23 tok/s، وهو صالح للمهام الدفعية لكن ليس للمحادثة التفاعلية. الميزة البارزة هي نافذة سياق بحجم 1,000K، لكن تعامل معها كرقم دعائي: فعند 128K فقط من السياق يرتفع الاستهلاك الكامل للذاكرة إلى نحو 50 GB، لذا على جهاز بسعة 32 GB ستعمل واقعيًا بضع عشرات الآلاف من الرموز، لا بمليون.

بالمقارنة مع نظرائه، يُعدّ Gemma 4 31B الخيار الأكثر مرونة إن كنت تحتاج إلى الرؤية، إذ إن Nemotron 3 Nano نصّي فقط، بينما Granite 4.0 H Small بديل كثيف بحجم مماثل إن كنت تفضّل تجنّب غرائب ذاكرة MoE. ما يبرع فيه Nemotron هو نسبة الإنتاجية إلى الجودة: لا شيء آخر في هذه الفئة الحجمية يولّد بهذه السرعة مع قدرته في الوقت نفسه على معالجة الاستدلال متعدد الخطوات. تنبيه قبل أن تبني عليه: رخصة NVIDIA Open Model مفتوحة الأوزان، لا مفتوحة المصدر فعليًا، لذا اقرأ بنودها بعناية بدل افتراض حرية بأسلوب Apache للاستخدام التجاري.

المواصفات

المعاملات31.6B (3.6B نشطة)
نافذة السياق1M رمز
المطوِّرNVIDIA
الرخصةNVIDIA Open Model
تاريخ الإصدار2025-12
الأفضل فيمحادثة, استدلال, برمجة

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.3513.2 GB24 GBفقدان ملحوظ
Q4_K_Mموصى به4.8519.2 GB32 GBموصى به
Q5_K_M5.6522.3 GB32 GBعالية
Q8_08.533.6 GB48 GBشبه أصلية
F161663.2 GB96 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~1.0 GB~20.2 GB
8K رمز~1.9 GB~21.1 GB
32K رمز~7.8 GB~27.0 GB
128K رمز~31.1 GB~50.3 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/sلا يتسع في VRAM
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run nemotron-3-nano:30b

الأسئلة الشائعة