← جميع النماذجفحص النموذج

هل يمكنني تشغيل Qwen 3.5 35B-A3B؟

يحتاج Qwen 3.5 35B-A3B من Alibaba إلى نحو 32 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 21.2 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~192 tok/s على Apple M-series Max.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج Qwen 3.5 35B-A3B هو نموذج مزيج من الخبراء (MoE) يقوم على حيلة ذكية في جوهره: من بين 35B معاملًا إجماليًا، يَنشط نحو 3B فقط لكل توكن. لذا فهو يولّد بسرعة نموذج صغير بينما يستند إلى معرفة نموذج كبير. لكن العقبة في الذاكرة: عليك تحميل النموذج كاملًا في RAM، فخطّط على أساس البصمة الكاملة لا الشريحة النشطة. عند التكميم 4-bit يقترب من 21 GB، وستحتاج إلى 32 GB من ذاكرة النظام على الأقل. بطاقة RTX 3060 بسعة 12 GB لن تتسع له، فعمليًا هذا نموذج لبطاقة GPU بسعة 24 GB أو لجهاز Apple Silicon عالي الذاكرة.

بمجرد أن يتسع، يثمر تصميم MoE ويبدو سريعًا بالنسبة لفئة وزنه. على بطاقة RTX 4090 قد ترى نحو 471 tok/s، وعلى Apple M Max نحو 192، وكلاهما سريع بما يكفي ليسبق الجواب سرعة قراءتك. أما المعالج CPU على ذاكرة DDR5 فيحقق نحو 28 tok/s، وهو بطيء لكنه صالح للعمل الدُفعي. يتعامل النموذج مع الدردشة والاستدلال والبرمجة والرؤية، مع نافذة سياق سخية تبلغ 256K. لكن تعامَل مع هذا السقف بحذر: عند سياق 128K تتسلّق بصمة الذاكرة الإجمالية إلى نحو 53.8 GB، لذا تتطلب جلسات السياق الطويل جهازًا ضخمًا فعلًا، لا مجرد ما يكفي لتحميل الأوزان.

في مقابل Command R 35B، وهو نموذج كثيف بالحجم نفسه يستحق المقارنة، يكمن الفارق الحقيقي في بنية MoE لا في عدد المعاملات: الحجم الاسمي ذاته، لكن Qwen يميل إلى العمل أسرع بكثير لكل توكن لأن 3B فقط نشطة. هذه النسبة بين السرعة والقدرة هي ميزته البارزة، إذ يمنحك توليدًا شبه فوري من نموذج يحمل معرفة بحجم 35B، إضافةً إلى دعم الرؤية متعدد الوسائط. أما نموذجا Qwen 3 0.6B و1.7B الأصغر فهما الخياران إن كنت مقيّدًا بالذاكرة وتحتاج دردشة أساسية فقط. الترخيص هو الجزء السهل: Apache 2.0 يعني أنه يمكنك استخدامه بحرية، بما في ذلك الاستخدام التجاري وفي الإنتاج، دون أي شروط خاصة بالمزوّد تحتاج إلى قراءتها.

المواصفات

المعاملات35B (3B نشطة)
نافذة السياق256K رمز
المطوِّرAlibaba
الرخصةApache 2.0
تاريخ الإصدار2026-02
الأفضل فيمحادثة, استدلال, برمجة, رؤية

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.3514.7 GB24 GBفقدان ملحوظ
Q4_K_Mموصى به4.8521.2 GB32 GBموصى به
Q5_K_M5.6524.7 GB48 GBعالية
Q8_08.537.2 GB48 GBشبه أصلية
F161670.0 GB96 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~1.0 GB~22.2 GB
8K رمز~2.0 GB~23.2 GB
32K رمز~8.1 GB~29.3 GB
128K رمز~32.6 GB~53.8 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/sلا يتسع في VRAM
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run qwen3.5:35b

الأسئلة الشائعة

متطلبات تشغيل Qwen 3.5 35B-A3B — هل يستطيع جهازي تشغيله؟