هل يمكنني تشغيل Mistral 7B؟
يحتاج Mistral 7B من Mistral AI إلى نحو 8 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 4.4 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~70 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Mistral 7B هو أول من أثبت فعليًا أن نموذجًا لغويًا صغيرًا مفتوح الأوزان يمكن أن يكون مفيدًا بحق، وما زال خيارًا منطقيًا لكل من يريد مساعد محادثة محليًا خفيفًا. بكمّنة 4-bit يبلغ حجمه نحو 4.4 GB، فيتسع بأريحية على بطاقة رسومات بسعة 8 GB، ويعمل بسهولة ضمن الذاكرة الموحّدة على أي جهاز Mac يعمل بمعالج Apple Silicon، بل إن بناءً بكمّنة 2-bit بحجم 3 GB تقريبًا متاح أيضًا إن كنت تحاول تشغيله على عتاد أقدم. ورخصته Apache 2.0 من أكثر الرخص تساهلًا: مجاني للاستخدام التجاري، دون أي قيود من المزوّد.
في الاستخدام اليومي يتميز بالسرعة والثبات في المحادثة والملخصات القصيرة. على بطاقة RTX 4090 يبلغ نحو 196 tok/s بكمّنة 4-bit، وحتى بطاقة RTX 3060 12GB المتواضعة تحافظ على نحو 70 tok/s، وهو أسرع من قدرتك على القراءة؛ أما معالج M-series Max فيقترب من 80 tok/s. ونافذة السياق البالغة 32K مريحة لكنها ليست هائلة، وملؤها بالكامل يرفع إجمالي الذاكرة إلى نحو 8.4 GB، لذا على بطاقة محدودة بسعة 8 GB يُستحسن إبقاء السياق العامل متواضعًا بدلًا من حشو النافذة كاملةً.
التحفّظ الصادق هنا هو العمر: فقد صدر في أواخر عام 2023، وهو يتأخر عن النماذج الصغيرة الأحدث في الاستدلال الأصعب واتباع التعليمات، ويتعامل Mistral Nemo 12B عمومًا بشكل أفضل مع المطالبات الأطول والأكثر تطلبًا إن كانت الذاكرة لديك تسمح بذلك. وفي البرمجة تحديدًا، يميل Qwen 2.5 Coder 7B إلى أن يكون الخيار الأقوى عند حجم مماثل. أما حيث يبقى Mistral 7B متفوقًا فهو البساطة والانتشار: فهو صغير جدًا، ومفتوح بالكامل تحت رخصة Apache 2.0، وتدعمه سنوات من الأدوات خلف وسم 'mistral' البسيط في Ollama، مما يجعله أساسًا موثوقًا لا مفاجآت فيه.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.0 GB | 6 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 4.4 GB | 8 GB | موصى به |
| Q5_K_M | 5.65 | 5.1 GB | 8 GB | عالية |
| Q8_0 | 8.5 | 7.7 GB | 12 GB | شبه أصلية |
| F16 | 16 | 14.4 GB | 24 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.5 GB | ~4.9 GB |
| 8K رمز | ~1.0 GB | ~5.4 GB |
| 32K رمز | ~4.0 GB | ~8.4 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~70 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~196 tok/s |
| Apple M-series (base) | 100 GB/s | ~19 tok/s |
| Apple M-series Pro | 270 GB/s | ~53 tok/s |
| Apple M-series Max | 410 GB/s | ~80 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~12 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run mistral