هل يمكنني تشغيل Codestral 22B؟
يحتاج Codestral 22B من Mistral AI إلى نحو 24 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 13.5 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~26 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Codestral 22B هو النموذج المخصص للبرمجة من Mistral AI، مبني لإكمال الكود وتوليده أكثر منه للدردشة المفتوحة. بـ 22.2 مليار وسيط، يمثل قفزة حقيقية في الحجم مقارنة بنماذج 7B-12B التي يبدأ بها معظم الناس، وبصمته الذاكرية تعكس ذلك: تبلغ نسخة التكميم 4-bit نحو 13.5 GB، ويحتاج النموذج إلى 24 GB من ذاكرة RAM على الأقل لكي يعمل بأريحية. هذا يضعه خارج متناول بطاقة سعتها 12 GB مثل RTX 3060، حيث لا يتسع ببساطة. نقطة الدخول الواقعية هي بطاقة GPU بسعة 24 GB مثل RTX 4090، أو جهاز Apple Silicon Mac بذاكرة موحّدة وفيرة.
على RTX 4090 يمكنك توقّع نحو 64 رمزًا في الثانية عند 4-bit، وهي سرعة كافية لتبدو اقتراحات الكود شبه فورية. أما Apple M-series Max فيأتي أدنى عند نحو 26 tok/s، ويبقى صالحًا للتحرير التفاعلي، في حين يهبط التشغيل على المعالج وحده فوق DDR5 إلى نحو 4 tok/s، وهي سرعة لا تصلح إلا للمهام الدفعية التي يمكنك تركها والانصراف عنها. نافذة السياق هي 32K، متواضعة بمعايير اليوم لكنها سخية لمعظم أعمال الملف الواحد والمستودعات الصغيرة. وإذا ملأتها بالكامل فستكون أمام نحو 20.1 GB من إجمالي الذاكرة، لذا على بطاقة سعتها 24 GB يترك السياق الكامل هامشًا ضئيلًا.
بمقارنته بنظرائه من العائلة نفسها، يُعد Codestral المتخصص: فإن Mistral Nemo 12B هو الخيار الأخف للدردشة العامة إذا كانت ذاكرتك محدودة، وعادةً ما يتفوق GPT-OSS 20B في الاستدلال والمحادثة. ميزة Codestral البارزة أنه دُرّب خصيصًا على الكود عبر لغات كثيرة، لذا في إكمال fill-in-the-middle (ملء المنتصف) والتوليد يميل إلى أن يكون أكثر دقة من نموذج عام بالحجم نفسه. التحذير الجدّي يكمن في الترخيص: يأتي Codestral بترخيص MNPL الخاص بـ Mistral، وهو ترخيص غير إنتاجي (non-production)، لذا لا يمكنك استخدامه تجاريًا أو في منتج إنتاجي. تعامل معه كأداة للبحث والاستخدام الشخصي فقط.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 9.3 GB | 16 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 13.5 GB | 24 GB | موصى به |
| Q5_K_M | 5.65 | 15.7 GB | 24 GB | عالية |
| Q8_0 | 8.5 | 23.6 GB | 32 GB | شبه أصلية |
| F16 | 16 | 44.4 GB | 64 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.8 GB | ~14.3 GB |
| 8K رمز | ~1.7 GB | ~15.2 GB |
| 32K رمز | ~6.6 GB | ~20.1 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~64 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~17 tok/s |
| Apple M-series Max | 410 GB/s | ~26 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run codestral