← جميع النماذجفحص النموذج

هل يمكنني تشغيل Qwen3-Next 80B-A3B؟

يحتاج Qwen3-Next 80B-A3B من Alibaba إلى نحو 64 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 48.5 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~192 tok/s على Apple M-series Max.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج Qwen3-Next 80B-A3B هو نموذج قائم على مزيج الخبراء (mixture-of-experts) من Alibaba، والرقم البارز فيه مضلِّل بطريقة مفيدة: فهو يضم 80B معاملًا إجماليًا لكنه يُفعِّل نحو 3B منها فقط لكل رمز (token). هذا يعني أنه يولّد النص بسرعة نموذج صغير بينما يستفيد من معرفة نموذج كبير. لكن العائق هو الذاكرة. ما زال عليك الاحتفاظ بالنموذج كاملًا في RAM أو VRAM، لذا حتى عند تكميم 4-bit بحجم نحو 48.5 GB تحتاج إلى 64 GB على الأقل لتشغيله، وهو ما يستبعد بطاقات الرسوميات الاستهلاكية المفردة ويوصلك نحو جهاز بذاكرة كبيرة بدلًا منها.

عمليًا هذا نموذج مخصص لأجهزة Apple Silicon أو محطات العمل، وليس لبطاقات رسوميات الألعاب. على معالج M Max بذاكرة موحّدة كافية يتدفق النص بسرعة تقارب 192 tok/s، وهي سرعة سريعة فعلًا لنموذج من فئة 80B وهي السبب الرئيسي الذي يدفع الناس لاختياره. بطاقة RTX 3060 بسعة 12 GB أو RTX 4090 بسعة 24 GB لا تستطيع ببساطة تحميله. إذا كنت تعمل على المعالج المركزي (CPU) مع ذاكرة DDR5 فلا يزال بإمكانك تشغيله بنحو 28 tok/s، أبطأ لكنه عملي للمهام المجمّعة. سياق 256K حقيقي لكنه شَرِه: الاقتراب من 128K قد يرفع إجمالي الذاكرة إلى نحو 95.8 GB، لذا خطِّط لهامش إضافي قبل أن تملأه.

في مقابل Llama 3.1 70B، المقارنة الكثيفة الواضحة، يميل Qwen3-Next إلى الشعور بأنه أسرع بوضوح بالنسبة لحجمه لأن 3B معاملًا فقط تكون نشطة في كل خطوة، بينما يضطر Llama لتشغيل الـ70B كلها. جودته في المحادثة والاستدلال تنافسية، رغم أن نماذج 70B الكثيفة قد تحتفظ بأفضلية في أصعب المطالبات متعددة الخطوات. ميزته البارزة هي نسبة السرعة إلى الحجم: اتساع نموذج كبير بزمن استجابة نموذج صغير، إن توفّرت لديك الذاكرة لاستضافته. الترخيص هو Apache 2.0، لذا أنت حر في استخدامه تجاريًا وفي بيئة الإنتاج دون قيود خاصة بمزوّد معيّن.

المواصفات

المعاملات80B (3B نشطة)
نافذة السياق256K رمز
المطوِّرAlibaba
الرخصةApache 2.0
تاريخ الإصدار2025-09
الأفضل فيمحادثة, استدلال

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.3533.5 GB48 GBفقدان ملحوظ
Q4_K_Mموصى به4.8548.5 GB64 GBموصى به
Q5_K_M5.6556.5 GB96 GBعالية
Q8_08.585.0 GB128 GBشبه أصلية
F1616160.0 GB256 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~1.5 GB~50.0 GB
8K رمز~3.0 GB~51.5 GB
32K رمز~11.8 GB~60.3 GB
128K رمز~47.3 GB~95.8 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/sلا يتسع في VRAM
NVIDIA RTX 4090 24GB1008 GB/sلا يتسع في VRAM
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run qwen3-next:80b

الأسئلة الشائعة