هل يمكنني تشغيل Phi-4 Mini 3.8B؟
يحتاج Phi-4 Mini 3.8B من Microsoft إلى نحو 6 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 2.3 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~133 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Phi-4 Mini 3.8B هو نموذج المحادثة الصغير من Microsoft، وهو الخيار الأمثل حين تريد شيئاً خفيفاً حقاً يظل قادراً على إدارة حوار متماسك. بتكميم 4-bit يصل حجمه إلى نحو 2.3 GB، ويهبط إلى ما يقارب 1.6 GB عند 2-bit، لذا يعمل في أي مكان تقريباً: بطاقة بذاكرة 6 GB تتسع له بسهولة، وجهاز M1 Mac من الفئة الأساسية يشغّله دون عناء، وحتى حاسوب محمول قديم على المعالج (CPU) يستطيع التعامل معه. ورخصة MIT هي الجزء السهل: لا شروط تقرأها ولا قيود تجارية، فبإمكانك دمجه في منتج بحرية تامة.
في الاستخدام اليومي يتميز بالسرعة. على بطاقة RTX 3060 ستحصل على نحو 133 tok/s، وجهاز M-series Max يقترب من 151 tok/s، بينما تتجاوز به بطاقة 4090 سرعة 370 tok/s، وهي أسرع بكثير من قدرتك على القراءة. سياق 128K هو الرقم اللافت لكن تعامل معه بحذر: عند ملئه ترتفع الذاكرة الكلية إلى نحو 14.3 GB، أي أبعد بكثير من 6 GB التي يحتاجها النموذج في حالة السكون. على بطاقة صغيرة أبقِ سياق العمل عند بضعة آلاف رمز وستظل مرتاحاً. وحتى المعالج على ذاكرة DDR5 يحقق نحو 22 tok/s للمطالبات القصيرة.
حيث يظهر حجمه الصغير هو العمق. في الاستدلال والتعليمات متعددة الخطوات يتفوق عادةً Qwen 3 4B رغم تقارب عدد المعاملات، وإن أردت هامشاً حقيقياً للاستدلال فإن Phi-4 14B هو الترقية الواضحة. ميزة Phi-4 Mini البارزة هي الكفاءة: فهو يقدّم أداءً يفوق حجمه البالغ 3.8B في المحادثة العادية والتلخيص، مع بقائه صغيراً بما يكفي للعمل في أي مكان تقريباً، برخصة MIT ودون قيود. إن أردت مساعداً محلياً صغيراً يُحمّل بسرعة ولا يقف في طريقك، فهذا خيار افتراضي قوي.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.6 GB | 4 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 2.3 GB | 6 GB | موصى به |
| Q5_K_M | 5.65 | 2.7 GB | 6 GB | عالية |
| Q8_0 | 8.5 | 4.0 GB | 8 GB | شبه أصلية |
| F16 | 16 | 7.6 GB | 12 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.4 GB | ~2.7 GB |
| 8K رمز | ~0.8 GB | ~3.1 GB |
| 32K رمز | ~3.0 GB | ~5.3 GB |
| 128K رمز | ~12.0 GB | ~14.3 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~133 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~372 tok/s |
| Apple M-series (base) | 100 GB/s | ~37 tok/s |
| Apple M-series Pro | 270 GB/s | ~100 tok/s |
| Apple M-series Max | 410 GB/s | ~151 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~22 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run phi4-mini