هل يمكنني تشغيل Ministral 3 8B؟
يحتاج Ministral 3 8B من Mistral AI إلى نحو 8 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 4.9 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~63 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
يمثّل Ministral 3 8B رؤية Mistral لأواخر عام 2025 للنموذج المحلي الصغير المتعدد المهام، وهو يتعامل مع المحادثة والرؤية معًا داخل حزمة واحدة بحجم 8B. عند تكميم 4-bit يأتي بحجم يقارب 4.9 GB، فيتسع على بطاقة رسومات بسعة 8 GB مع هامش مريح، ويعمل دون مشاكل ضمن الذاكرة الموحّدة على أي جهاز Mac بمعالج Apple Silicon. ورقم الحد الأدنى للذاكرة البالغ 8 GB صادق بالنسبة للأوزان وحدها، ما يجعل هذا النموذج خيارًا واقعيًا لحاسوب محمول أو لبطاقة رسومات مستعملة رخيصة بدلًا من شيء يتطلب محطة عمل لاستضافته.
في الاستخدام اليومي يبدو سريعًا. على بطاقة RTX 3060 يمكنك توقّع نحو 63 tok/s عند 4-bit، بينما تدفع 4090 ذلك إلى ما يقارب 177، ويقف معالج M-series Max قرب 72، وكلها أسرع مما تستطيع قراءته من ردٍّ يتدفّق. العنوان البارز هو نافذة السياق بسعة 256K، لكن عامِلها كحدٍّ أقصى لا كقيمة افتراضية. فعند سياق بحجم 128K يرتفع إجمالي بصمة الذاكرة إلى نحو 21.7 GB، وهو ما يتجاوز بكثير ما تستوعبه بطاقة بسعة 8 GB، لذا أبقِ السياق العملي ضمن بضعة آلاف من الرموز ما لم تتوفّر لديك ذاكرة VRAM تدعم النافذة الطويلة.
في مواجهة أقاربه يتموضع في المنتصف: عادةً ما يملك Mistral Nemo 12B هامشًا أكبر للاستدلال الأصعب إن كنت تتحمّل النموذج الأكبر، بينما يبقى Mistral 7B البديل الأنحف حين تكون الذاكرة شحيحة. أبرز سمات Ministral 3 8B أن الرؤية تقع ضمن البصمة الصغيرة نفسها، فتحصل على فهم الصور دون الانتقال إلى نموذج متعدد الوسائط أثقل. ويصدر برخصة Apache 2.0، ما يعني أنه يمكنك استخدامه تجاريًا وفي بيئة الإنتاج دون أي قيود خاصة بالمزوّد، وهي رخصة نظيفة فعلًا لنموذج بهذه القدرة.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 4.9 GB | 8 GB | موصى به |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | عالية |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | شبه أصلية |
| F16 | 16 | 16.0 GB | 24 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.5 GB | ~5.4 GB |
| 8K رمز | ~1.0 GB | ~5.9 GB |
| 32K رمز | ~4.2 GB | ~9.1 GB |
| 128K رمز | ~16.8 GB | ~21.7 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run ministral-3:8b