← جميع النماذجفحص النموذج

هل يمكنني تشغيل Qwen 3 30B-A3B؟

يحتاج Qwen 3 30B-A3B من Alibaba إلى نحو 32 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 18.5 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~174 tok/s على Apple M-series Max.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج Qwen 3 30B-A3B يعتمد على بنية مزيج الخبراء (mixture-of-experts)، وهذه الحقيقة وحدها تحدد طريقة فهمك له بالكامل. فهو يملك 30.5B معاملاً على الورق، لكن 3.3B فقط منها تُفعَّل لكل رمز (token)، لذا يعمل بسرعة نموذج صغير بينما يفكّر بسعة نموذج كبير. العقبة هي الذاكرة: عليك أن تحتفظ بالنموذج كاملاً في الـ RAM. تبلغ نسخة الكمّ 4-bit نحو 18.5 GB، ويحتاج النموذج إلى 32 GB على الأقل ليتنفس بأريحية، ما يستبعد بطاقة بسعة 12 GB مثل RTX 3060، لكنه يناسب جهاز Apple Silicon Mac بسعة 32 GB دون عناء، أو بطاقة 4090 بسعة 24 GB إذا أبقيت السياق متواضعاً.

في الاستخدام اليومي تؤتي بنية MoE ثمارها بشكل لا تنصفه ورقة المواصفات. على بطاقة 4090 يمكنك رؤية نحو 428 tok/s، وحتى شريحة M-series Max تبقى سريعة عند 174 tok/s تقريباً، أسرع بكثير مما يحققه نموذج كثيف بحجم 30B على العتاد نفسه. أما على المعالج وحده مع ذاكرة DDR5 فتهبط السرعة إلى نحو 25 tok/s، وهي مقبولة للمهام الدُفعية لكنها لا تصلح للمحادثة التفاعلية. سياق 128K حقيقي فعلاً، لكن انتبه للميزانية: ملؤه بالكامل يرفع إجمالي الذاكرة إلى نحو 49.1 GB، لذا على جهاز بسعة 32 GB تُبقي سياق العمل متواضعاً وتعتمد على كمٍّ أصغر بدل ملاحقة النافذة الكاملة.

بمقارنته بـ Gemma 4 31B، الذي يقف عند 30.7B معاملاً تقريباً وهو رقم شبه مطابق، تتضح المفاضلة. فـ Gemma كثيف ويضيف البرمجة والرؤية، لذا يميل إلى التفوق في المهام متعددة الوسائط والعمل البرمجي المنظَّم، بينما يجعل التصميم المتفرق في Qwen 3 30B-A3B أسرع بفارق كبير لكل رمز في المحادثة والاستدلال ضمن هذه الفئة من الأحجام. تلك السرعة مقابل بصمته في الذاكرة هي ميزته البارزة. كما يصدر برخصة Apache 2.0، لذا بخلاف شروط الأوزان المفتوحة الخاصة بمزوّدين بعينهم، يمكنك استخدامه بحرية في الأعمال التجارية والإنتاجية دون أي قيود ترخيص خفية.

المواصفات

المعاملات30.5B (3.3B نشطة)
نافذة السياق128K رمز
المطوِّرAlibaba
الرخصةApache 2.0
تاريخ الإصدار2025-04
الأفضل فيمحادثة, استدلال

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.3512.8 GB24 GBفقدان ملحوظ
Q4_K_Mموصى به4.8518.5 GB32 GBموصى به
Q5_K_M5.6521.5 GB32 GBعالية
Q8_08.532.4 GB48 GBشبه أصلية
F161661.0 GB96 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~1.0 GB~19.5 GB
8K رمز~1.9 GB~20.4 GB
32K رمز~7.7 GB~26.2 GB
128K رمز~30.6 GB~49.1 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/sلا يتسع في VRAM
NVIDIA RTX 4090 24GB1008 GB/s~428 tok/s
Apple M-series (base)100 GB/s~42 tok/s
Apple M-series Pro270 GB/s~115 tok/s
Apple M-series Max410 GB/s~174 tok/s
CPU only (dual-channel DDR5)60 GB/s~25 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run qwen3:30b

الأسئلة الشائعة

متطلبات تشغيل Qwen 3 30B-A3B — هل يستطيع جهازي تشغيله؟