هل يمكنني تشغيل Command R 35B؟
يحتاج Command R 35B من Cohere إلى نحو 32 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 21.2 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~16 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
يُعَدّ Command R 35B نموذج Cohere المخصص للدردشة و RAG، وهو يطلب من عتادك أكثر بكثير من نماذج 7-8B التي يبدأ بها معظم الناس. بدقة 4-bit يبلغ حجمه نحو 21 GB، لذا فإن بطاقة RTX 3060 بسعة 12 GB خارج الحساب تمامًا، وتحتاج إلى 32 GB على الأقل من ذاكرة النظام لتحميله بأريحية. المكان الواقعي له هو بطاقة بسعة 24 GB مثل RTX 4090، أو جهاز Apple Silicon Mac بذاكرة موحَّدة وفيرة. أمّا النزول إلى تكميم 2-bit (نحو 15 GB) فلا تلجأ إليه إلا إذا كنت مضغوطًا ومستعدًا لتقبّل تراجع الجودة.
في الاستخدام اليومي هو ثابت أكثر منه سريع. على RTX 4090 يمكنك توقّع نحو 40 رمزًا في الثانية بدقة 4-bit، وهو يتدفّق أسرع من قراءتك؛ وعلى شريحة M-series Max يستقر قرب 16 tok/s، صالح للاستخدام لكنه أبطأ بشكل ملحوظ؛ وعلى معالج CPU مع ذاكرة DDR5 ستحصل على نحو 2 tok/s تقريبًا، وهي منطقة تختبر صبرك. نافذة السياق 128K كبيرة فعلًا، لكن استخدامها مكلِف: إذا ملأتها يرتفع إجمالي الذاكرة إلى نحو 54 GB، لذا ما لم يكن لديك إعداد بسعة 48 GB أو أكثر، أبقِ سياق العمل معتدلًا واحتفظ بالنافذة الكاملة للمستندات الطويلة العَرَضية.
أمام الجيل الحالي من النماذج، يُظهر عمره الذي يعود إلى 2024. نماذج Qwen 3.5 و 3.6 بصيغة 35B-A3B في القائمة ذات الصلة هي تصاميم MoE تبدو عمومًا أسرع وأقوى في الاستدلال والبرمجة، وهي مجالات لم تكن يومًا محور تركيز Command R. تبقى ميزته البارزة ما صمّمته Cohere من أجله: دردشة معزَّزة بالاسترجاع (RAG) مستندة إلى المصادر ومدعومة بالاقتباسات، حيث يميل إلى الالتزام بالمصدر بدل التشتّت. لكن هناك تحذير صارم واحد: الأوزان مرخَّصة بموجب CC-BY-NC، أي للاستخدام غير التجاري فقط. يمكنك تشغيله للمشاريع الشخصية والبحث، لكن لا يمكنك طرحه ضمن منتج أو أي خدمة مدفوعة.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 21.2 GB | 32 GB | موصى به |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | عالية |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | شبه أصلية |
| F16 | 16 | 70.0 GB | 96 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~1.0 GB | ~22.2 GB |
| 8K رمز | ~2.0 GB | ~23.2 GB |
| 32K رمز | ~8.1 GB | ~29.3 GB |
| 128K رمز | ~32.6 GB | ~53.8 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~40 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~16 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~2 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run command-r