← جميع النماذجفحص النموذج

هل يمكنني تشغيل Qwen 3.5 9B؟

يحتاج Qwen 3.5 9B من Alibaba إلى نحو 12 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 5.5 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~56 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

Qwen 3.5 9B هو النموذج العام من Alibaba الصادر مطلع 2026، والأمر اللافت فيه أنه إلى جانب المحادثة والاستدلال يستطيع معالجة الصور (vision)، أي أنه لا يقتصر على النص وحده. مع التكميم (quant) بدقة 4-bit ينزل إلى نحو 5.5 GB، وهو حجم يمكن أن يعمل ولو بصعوبة على GPU بسعة 12 GB، ويستقر بأريحية في الذاكرة الموحدة على أجهزة Mac المزوّدة بـ Apple Silicon. وإذا أردت إدخاله في عتاد أصغر فبإمكانك النزول إلى نسخة 2-bit بحجم 3.8 GB تقريبًا، لكنك ستدفع ثمن ذلك من الجودة. عمليًا احسب حدًا أدنى يقارب 12 GB من ذاكرة النظام.

في الاستخدام اليومي يبدو سريعًا. على RTX 3060 بدقة 4-bit يمكنك توقع نحو 56 رمزًا في الثانية (~56 tok/s)، بينما يرفعها طراز M من فئة Max إلى ما يقارب ~64 tok/s — وكلاهما أسرع من سرعة قراءتك. وإذا توفّر لديك RTX 4090 فهو يتقدّم بفارق كبير عند نحو 157 tok/s. نافذة السياق البالغة 256K هي الرقم اللافت، لكن كن واقعيًا في موضوع الذاكرة: حتى عند سياق 128K يرتفع إجمالي البصمة إلى نحو 23.2 GB، وهذا يتجاوز بكثير بطاقة بسعة 12 GB. وإن لم يكن لديك GPU بسعة 24 GB فأبقِ سياق العمل ضمن حدود معقولة.

موقعه ضمن عائلته واضح جدًا: نماذج Qwen 3 0.6B و1.7B هي نماذج خفيفة الوزن للمحادثة فقط مخصّصة للعتاد المحدود، أما هذا النموذج 9B فهو الذي تلجأ إليه حين تريد الاستدلال وفهم الصور في نموذج واحد. وGLM-4.6V-Flash بديل مقارب بالحجم نفسه وقادر على معالجة الصور، وغالبًا ما يسير الاثنان جنبًا إلى جنب تبعًا للمهمة. ما يميّز Qwen 3.5 9B هو اتساع نطاقه في تنزيل واحد، وبفضل رخصة Apache 2.0 يمكنك استخدامه تجاريًا دون أي شروط مقيّدة.

المواصفات

المعاملات9B
نافذة السياق256K رمز
المطوِّرAlibaba
الرخصةApache 2.0
تاريخ الإصدار2026-03
الأفضل فيمحادثة, استدلال, رؤية

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.353.8 GB8 GBفقدان ملحوظ
Q4_K_Mموصى به4.855.5 GB12 GBموصى به
Q5_K_M5.656.4 GB12 GBعالية
Q8_08.59.6 GB16 GBشبه أصلية
F161618.0 GB24 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.6 GB~6.1 GB
8K رمز~1.1 GB~6.6 GB
32K رمز~4.4 GB~9.9 GB
128K رمز~17.7 GB~23.2 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~56 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~157 tok/s
Apple M-series (base)100 GB/s~16 tok/s
Apple M-series Pro270 GB/s~42 tok/s
Apple M-series Max410 GB/s~64 tok/s
CPU only (dual-channel DDR5)60 GB/s~9 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run qwen3.5:9b

الأسئلة الشائعة