هل يمكنني تشغيل Qwen 3 1.7B؟
يحتاج Qwen 3 1.7B من Alibaba إلى نحو 3 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 1.0 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~297 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Qwen 3 1.7B هو نموذج محادثة صغير موجّه لمن يريد مساعدًا محليًا يُحمَّل فورًا وبالكاد يستهلك موارد جهازه. بكمّنة 4-bit يبلغ حجمه على القرص نحو 1 GB، ويعمل بالكامل ضمن حوالي 3 GB من الـ RAM، لذا يتسع تقريبًا على أي شيء: حاسوب محمول قديم، لوحة من فئة Raspberry Pi، هاتف، أو كرت رسوميات منخفض المستوى نسيت أنك تملكه. هذا هو النموذج الذي تلجأ إليه عندما لا تملك بطاقة رسوميات مخصصة، أو حين تريد شيئًا يعمل في الخلفية دون أن تفكر في الذاكرة إطلاقًا.
على بطاقة رسوميات حقيقية تكون سرعته سخيفة تقريبًا. يدفع RTX 3060 نحو 297 tok/s، ويتجاوز الـ 4090 حاجز 831، بينما يستقر معالج Apple Silicon M Max قرب 338. وحتى على المعالج المركزي وحده مع ذاكرة DDR5 يحقق نحو 49 tok/s، وهي سرعة أعلى مما تقرأ به. نافذة السياق تبلغ 32K، وبخلاف النماذج الثقيلة يمكنك فعليًا ملؤها هنا دون عناء كبير: عند السياق الكامل 32K يبقى الاستهلاك الإجمالي عند حوالي 3.1 GB فقط، لذا يستطيع جهاز متواضع أن يحتفظ بمحادثة طويلة في الذاكرة براحة.
وقت الصراحة: بـ 1.7B معامل، هذا نموذج محادثة لا محرّك استدلال. يتعامل جيدًا مع الأسئلة والأجوبة القصيرة، وإعادة الصياغة، واستدعاء الأدوات البسيط، لكنه يصبح هشًّا مع المنطق متعدد الخطوات أو أي شيء يتطلب تخطيطًا فعليًا. إن كانت لديك الذاكرة الكافية، فإن Qwen 3 4B يستدل عمومًا بشكل أفضل بوضوح؛ وإن كنت أكثر تقييدًا، فإن Qwen 3 0.6B هو الخطوة الأخف نزولًا، بينما يُعدّ SmolLM2 1.7B نظيرًا بالحجم نفسه يستحق الموازنة معه. ميزته البارزة هي نسبة السرعة إلى الحجم، ولأنه بترخيص Apache 2.0 يمكنك استخدامه تجاريًا وفي الإنتاج دون أي قلق بشأن الترخيص.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 1.0 GB | 3 GB | موصى به |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | عالية |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | شبه أصلية |
| F16 | 16 | 3.4 GB | 6 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.3 GB | ~1.3 GB |
| 8K رمز | ~0.5 GB | ~1.5 GB |
| 32K رمز | ~2.1 GB | ~3.1 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run qwen3:1.7b