هل يمكنني تشغيل DeepSeek R1 14B؟
يحتاج DeepSeek R1 14B من DeepSeek إلى نحو 16 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 9.0 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~34 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
DeepSeek R1 14B هو نموذج استدلال، وليس رفيقًا للدردشة السريعة. بحجم 14.8B معامل يقع في المنطقة الوسطى المحرجة: تصل نسخة 4-bit المكمّمة إلى نحو 9 GB، وهو ما يتجاوز بطاقة بسعة 12 GB بمجرد إضافة السياق، والحد الأدنى الموصى به هو 16 GB من الذاكرة. يعمل بسلاسة على بطاقة بسعة 24 GB مثل RTX 4090 أو جهاز Apple Silicon Mac بذاكرة أعلى، لكنك على بطاقة RTX 3060 بسعة 12 GB تكون عند الحافة تمامًا. رخصة MIT هي الجزء السهل: قابلة للاستخدام بحرية، بما في ذلك الاستخدام التجاري، دون أي قيود من المزوّد.
في الاستخدام اليومي يفكّر بصوت عالٍ قبل أن يجيب، لذا توقّع سلاسل طويلة من رموز الاستدلال مع كل طلب. على RTX 4090 تحصل على نحو 95 tok/s، سريع بما يكفي لتدفق الاستدلال أمامك؛ وعلى RTX 3060 ينخفض إلى نحو 34 tok/s، وعلى جهاز M-Max Mac إلى نحو 39 tok/s، حيث تبدأ تلك السلاسل الطويلة بالشعور بالبطء. سياق 128K حقيقي لكنه مكلف: ملؤه يدفع إجمالي الذاكرة إلى نحو 31.1 GB، أي أبعد بكثير من أي إعداد بسعة 16 GB، لذا أبقِ سياق العمل متواضعًا ما لم يكن لديك جهاز بسعة 32 GB أو أكثر.
مقارنةً بـ Qwen 3 14B، الذي يحمل العدد نفسه من المعاملات 14.8B لكنه يتعامل مع الدردشة العادية أيضًا، يُعدّ R1 14B الخيار الأكثر تخصصًا: فهو يكافئك عمومًا في الرياضيات والمنطق متعددة الخطوات، لكنه يبدو ثقيل الوطأة في الحوارات البسيطة، حيث يميل Qwen إلى أن يكون أسرع وأكثر مباشرة. ميزته البارزة هي الاستدلال الشفّاف بحجم يمكنك فعليًا استضافته بنفسك. وإن أردت النهج نفسه بصورة أخف، فإن DeepSeek R1 7B ينزل إلى نحو نصف عدد المعاملات ويتسع بشكل أكثر راحة على بطاقة بسعة 12 GB.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.2 GB | 12 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 9.0 GB | 16 GB | موصى به |
| Q5_K_M | 5.65 | 10.5 GB | 16 GB | عالية |
| Q8_0 | 8.5 | 15.7 GB | 24 GB | شبه أصلية |
| F16 | 16 | 29.6 GB | 48 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.7 GB | ~9.7 GB |
| 8K رمز | ~1.4 GB | ~10.4 GB |
| 32K رمز | ~5.5 GB | ~14.5 GB |
| 128K رمز | ~22.1 GB | ~31.1 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~95 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~26 tok/s |
| Apple M-series Max | 410 GB/s | ~39 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run deepseek-r1:14b