هل يمكنني تشغيل Devstral 24B؟
يحتاج Devstral 24B من Mistral AI إلى نحو 24 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 14.6 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~24 tok/s على Apple M-series Max.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
Devstral 24B هو نموذج Mistral AI المتخصص في البرمجة، مصمَّم لمن يريد وكيلاً محلياً قادراً على مهام تطوير البرمجيات لا رفيق محادثة عام. بـ 24B معاملاً كثيفاً (dense) فهو ليس خفيف الوزن: تأتي نسخة الـ 4-bit عند نحو 14.6 GB، ويحتاج النموذج إلى ما لا يقل عن 24 GB من الـ RAM ليعمل بأريحية. هذا يضعه خارج متناول بطاقة بسعة 12 GB مثل RTX 3060، فهو ببساطة لا يتسع فيها. موطنه الطبيعي بطاقة GPU بسعة 24 GB مثل RTX 4090، أو جهاز Apple Silicon Mac بذاكرة موحَّدة وفيرة. وإن ضاقت بك المساحة، تنخفض نسخة الـ 2-bit إلى نحو 10.1 GB.
في الاستخدام البرمجي اليومي على RTX 4090 يمكنك توقّع نحو 59 tok/s عند 4-bit، وهي سرعة كافية لتدفّق الكود المُولَّد بسلاسة أثناء قراءتك له. على Apple M-series Max يستقر الرقم قرب 24 tok/s، وهو لا يزال صالحاً تماماً للعمل التفاعلي، بينما يهبط على الـ CPU وحده مع ذاكرة DDR5 إلى نحو 4 tok/s، وهي منطقة تتطلّب صبراً. نافذة السياق 128K كبيرة فعلاً، لكنها ليست مجانية: ملؤها يرفع إجمالي الذاكرة إلى نحو 42.1 GB، أي أبعد بكثير من بصمة النموذج في حالة السكون، فأبقِ سياق العمل معتدلاً ما لم تتوفر لديك سعة فائضة.
مقارنةً بأبناء عائلته، يُعدّ Devstral 24B الثقيل: فـ Mistral 7B وMistral Nemo 12B أخفّ بكثير وموجَّهان للمحادثة العامة، لذا يعملان على عتاد لا يستطيع Devstral الاقتراب منه، لكنهما يتأخّران عنه عموماً في مهام البرمجة الفعلية. المقارنة الأقرب هي Gemma 4 26B A4B، وهو نموذج بحجم مماثل يتولّى البرمجة إلى جانب المحادثة والاستدلال والرؤية، ويميل إلى أن يكون المتعدد المهام الأكثر مرونة إن أردت نموذجاً واحداً لكل شيء. ميزة Devstral البارزة هي تركيزه الضيّق على الكود، وترخيص Apache 2.0 يعني أنه بإمكانك استخدامه بحرّية، بما في ذلك في الإنتاج التجاري.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 14.6 GB | 24 GB | موصى به |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | عالية |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | شبه أصلية |
| F16 | 16 | 48.0 GB | 64 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.9 GB | ~15.5 GB |
| 8K رمز | ~1.7 GB | ~16.3 GB |
| 32K رمز | ~6.9 GB | ~21.5 GB |
| 128K رمز | ~27.5 GB | ~42.1 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | لا يتسع في VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run devstral