هل يمكنني تشغيل Qwen 3.5 9B؟
يحتاج Qwen 3.5 9B من Alibaba إلى نحو 12 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 5.5 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~56 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Qwen 3.5 9B هو النموذج العام من Alibaba الصادر مطلع 2026، والأمر اللافت فيه أنه إلى جانب المحادثة والاستدلال يستطيع معالجة الصور (vision)، أي أنه لا يقتصر على النص وحده. مع التكميم (quant) بدقة 4-bit ينزل إلى نحو 5.5 GB، وهو حجم يمكن أن يعمل ولو بصعوبة على GPU بسعة 12 GB، ويستقر بأريحية في الذاكرة الموحدة على أجهزة Mac المزوّدة بـ Apple Silicon. وإذا أردت إدخاله في عتاد أصغر فبإمكانك النزول إلى نسخة 2-bit بحجم 3.8 GB تقريبًا، لكنك ستدفع ثمن ذلك من الجودة. عمليًا احسب حدًا أدنى يقارب 12 GB من ذاكرة النظام.
في الاستخدام اليومي يبدو سريعًا. على RTX 3060 بدقة 4-bit يمكنك توقع نحو 56 رمزًا في الثانية (~56 tok/s)، بينما يرفعها طراز M من فئة Max إلى ما يقارب ~64 tok/s — وكلاهما أسرع من سرعة قراءتك. وإذا توفّر لديك RTX 4090 فهو يتقدّم بفارق كبير عند نحو 157 tok/s. نافذة السياق البالغة 256K هي الرقم اللافت، لكن كن واقعيًا في موضوع الذاكرة: حتى عند سياق 128K يرتفع إجمالي البصمة إلى نحو 23.2 GB، وهذا يتجاوز بكثير بطاقة بسعة 12 GB. وإن لم يكن لديك GPU بسعة 24 GB فأبقِ سياق العمل ضمن حدود معقولة.
موقعه ضمن عائلته واضح جدًا: نماذج Qwen 3 0.6B و1.7B هي نماذج خفيفة الوزن للمحادثة فقط مخصّصة للعتاد المحدود، أما هذا النموذج 9B فهو الذي تلجأ إليه حين تريد الاستدلال وفهم الصور في نموذج واحد. وGLM-4.6V-Flash بديل مقارب بالحجم نفسه وقادر على معالجة الصور، وغالبًا ما يسير الاثنان جنبًا إلى جنب تبعًا للمهمة. ما يميّز Qwen 3.5 9B هو اتساع نطاقه في تنزيل واحد، وبفضل رخصة Apache 2.0 يمكنك استخدامه تجاريًا دون أي شروط مقيّدة.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.8 GB | 8 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 5.5 GB | 12 GB | موصى به |
| Q5_K_M | 5.65 | 6.4 GB | 12 GB | عالية |
| Q8_0 | 8.5 | 9.6 GB | 16 GB | شبه أصلية |
| F16 | 16 | 18.0 GB | 24 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.6 GB | ~6.1 GB |
| 8K رمز | ~1.1 GB | ~6.6 GB |
| 32K رمز | ~4.4 GB | ~9.9 GB |
| 128K رمز | ~17.7 GB | ~23.2 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~56 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~157 tok/s |
| Apple M-series (base) | 100 GB/s | ~16 tok/s |
| Apple M-series Pro | 270 GB/s | ~42 tok/s |
| Apple M-series Max | 410 GB/s | ~64 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~9 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run qwen3.5:9b