← جميع النماذجفحص النموذج

هل يمكنني تشغيل Qwen 3 0.6B؟

يحتاج Qwen 3 0.6B من Alibaba إلى نحو 2 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 0.4 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~841 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج Qwen 3 0.6B صغير حقًا، وهذا هو بيت القصيد. بدقة 4-bit يبلغ حجمه نحو 0.4 GB، وحتى نسخة q8 لا تتجاوز 0.6 GB، فيتسع داخل 2 GB من الذاكرة مع فائض مريح. هذا يعني أنه يعمل عمليًا على أي شيء: حاسوب محمول قديم، لوحة من فئة Raspberry Pi، هاتف، أو ركن صغير من أي معالج رسوميات حديث. اعتبره النموذج الذي تلجأ إليه حين تريد توليد نص محليًا على عتاد لا يُفترض به أصلًا أن يشغّل نموذجًا لغويًا، لا مساعدًا يفعل كل شيء.

في الاستخدام اليومي، السمة الأبرز هي السرعة الخام. على بطاقة RTX 3060 يولّد نحو 841 رمزًا في الثانية، وعلى شريحة M-series Max يقترب من 958، أما على 4090 فيصل إلى ما يقارب 2355 رمزًا في الثانية، وهذا أسرع بكثير مما يمكنك قراءته، وسريع بما يكفي لدمجه في حلقات ضيقة أو مهام دفعية. حتى على معالج مركزي مزوّد بذاكرة DDR5 تحصل على نحو 140 tok/s، وهي سرعة عملية تمامًا. نافذة السياق 32K حقيقية، ولأن كل شيء يبقى صغيرًا، فإن سياق 32K محمّلًا بالكامل لا يحتاج سوى نحو 1.7 GB إجمالًا، فنادرًا ما تضطر للقلق بشأن ضغط ذاكرة KV-cache هنا.

كن صريحًا مع نفسك بخصوص المقايضة: بـ 0.6B معاملًا هذا نموذج محادثة لا نموذج استدلال. لأي مهمة متعددة الخطوات أو مبنيّة على بنية محددة أو كثيفة البرمجة، يتقدم عادةً Qwen 3 4B من العائلة نفسها بفارق واضح، وحتى Qwen 3 1.7B يميل إلى اتباع التعليمات بموثوقية أكبر. مقابل Gemma 3 1B يبقى الخيار الأخف والأسرع، وإن كانا في منطقة متقاربة للمحادثة البسيطة. ميزته الحقيقية هي صغر البصمة مع السرعة، والرخصة تساعد أيضًا: Apache 2.0 تعني أنه بإمكانك استخدامه بحرية، بما في ذلك تجاريًا، دون أي قيود خاصة بمزوّد معيّن.

المواصفات

المعاملات0.6B
نافذة السياق32K رمز
المطوِّرAlibaba
الرخصةApache 2.0
تاريخ الإصدار2025-04
الأفضل فيمحادثة

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.350.3 GB2 GBفقدان ملحوظ
Q4_K_Mموصى به4.850.4 GB2 GBموصى به
Q5_K_M5.650.4 GB2 GBعالية
Q8_08.50.6 GB3 GBشبه أصلية
F16161.2 GB3 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.2 GB~0.6 GB
8K رمز~0.3 GB~0.7 GB
32K رمز~1.3 GB~1.7 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~841 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~2355 tok/s
Apple M-series (base)100 GB/s~234 tok/s
Apple M-series Pro270 GB/s~631 tok/s
Apple M-series Max410 GB/s~958 tok/s
CPU only (dual-channel DDR5)60 GB/s~140 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run qwen3:0.6b

الأسئلة الشائعة

متطلبات تشغيل Qwen 3 0.6B — هل يستطيع جهازي تشغيله؟