هل يمكنني تشغيل DeepSeek R1 70B؟
يحتاج DeepSeek R1 70B من DeepSeek إلى نحو 64 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 42.8 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~8 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
DeepSeek R1 70B هو النموذج الذي تلجأ إليه حين تريد تشغيل الاستدلال بسلسلة التفكير بالكامل على عتادك الخاص، لا مجرد مساعد دردشة سريع. بدقة 4-bit يبلغ حجمه نحو 42.8 GB ويحتاج إلى ما لا يقل عن 64 GB من ذاكرة RAM، وهذا يستبعد تماماً تشغيله على بطاقة رسوميات استهلاكية واحدة: فهو لن يتسع على RTX 3060 12GB ولا حتى على RTX 4090 24GB. المكان الواقعي له هو جهاز Mac بذاكرة موحدة وفيرة أو محطة عمل بسعة 64 GB أو أكثر، حيث يمكن لمجموعة الأوزان الكاملة أن تبقى مقيمة في الذاكرة فعلياً. هذا التزام جدّي، وليس تنزيلاً عابراً.
في الاستخدام اليومي، الحقيقة الصريحة هي أنه بطيء. على Apple M-Max ستحصل على نحو 8 tok/s، وعلى معالج CPU بذاكرة DDR5 ينخفض الرقم إلى نحو 1 tok/s، فتصل الردود بسرعة القراءة في أفضل الأحوال وتزحف زحفاً في أسوئها. ولأن R1 يفكّر بصوتٍ عالٍ قبل أن يجيب، تذهب نسبة كبيرة من تلك الـ tokens إلى استدلال ظاهر، لذا قد يستغرق رد واحد وقتاً طويلاً. نافذة السياق 128K موجودة، لكن ملأها يرفع إجمالي الذاكرة إلى نحو 87.5 GB، أي أبعد بكثير من حدّ الـ 64 GB، لذا أبقِ سياق العمل متواضعاً ما لم يكن لديك فائض كافٍ.
في مقارنته بأبناء عائلته، المفاضلة واضحة: يعمل DeepSeek R1 7B أو النسخة الصغيرة 1.5B بسرعة أكبر بكثير ويتسعان على عتاد متواضع، لكن نموذج 70B هذا عادةً ما يصمد بشكل أفضل في الاستدلال متعدد الخطوات الأصعب، حيث تميل النسخ المقطّرة الأصغر إلى فقدان الخيط. وبالمقارنة مع Llama 3.1 70B المضبوط للدردشة، فإن السمة البارزة في R1 70B هي أسلوب الاستدلال الصريح، وهو أنسب لمسائل الرياضيات والمنطق منه للمحادثة المفتوحة. ورخصة MIT هي الجزء السهل هنا: يمكنك استخدامه تجارياً وفي بيئة الإنتاج دون قيود خاصة بمزوّد بعينه. فقط خصّص ميزانية للذاكرة وللانتظار.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 29.6 GB | 48 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 42.8 GB | 64 GB | موصى به |
| Q5_K_M | 5.65 | 49.9 GB | 64 GB | عالية |
| Q8_0 | 8.5 | 75.0 GB | 96 GB | شبه أصلية |
| F16 | 16 | 141.2 GB | 192 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~1.4 GB | ~44.2 GB |
| 8K رمز | ~2.8 GB | ~45.6 GB |
| 32K رمز | ~11.2 GB | ~54.0 GB |
| 128K رمز | ~44.7 GB | ~87.5 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | لا يتسع في VRAM |
| Apple M-series (base) | 100 GB/s | ~2 tok/s |
| Apple M-series Pro | 270 GB/s | ~5 tok/s |
| Apple M-series Max | 410 GB/s | ~8 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~1 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run deepseek-r1:70b