هل يمكنني تشغيل Phi-4 Reasoning Vision 15B؟
يحتاج Phi-4 Reasoning Vision 15B من Microsoft إلى نحو 16 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 9.1 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~34 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج Phi-4 Reasoning Vision 15B هو نموذج مفتوح الأوزان من Microsoft برخصة MIT، أي أنه قابل للاستخدام التجاري بحرية، وقد صُمّم للرؤية والاستدلال أكثر من الدردشة العامة. إنه نموذج كثيف بحجم 15B معامل، ما يعني أنه يُحمَّل ويعمل بالكامل مع كل توكِن. عند التكميم بدقة 4-bit يصل حجمه إلى نحو 9.1 GB، لذا تحتاج إلى بطاقة بسعة 12 GB مثل RTX 3060 لإبقائه كاملاً على كرت الرسوميات، مع 16 GB على الأقل من ذاكرة النظام. يمكنك النزول إلى بناء 2-bit (نحو 6.3 GB) إذا كنت تضغطه على عتاد أضيق، لكن الجودة تتراجع عند هذا المستوى.
في الاستخدام اليومي يبدو سريعاً على RTX 3060 بسعة 12 GB، بنحو 34 توكِن في الثانية عند 4-bit، وهو مريح لسرعة القراءة، بينما تدفعه بطاقة RTX 4090 بسعة 24 GB إلى نحو 94 توكِن في الثانية. وعلى معالج Apple من فئة M-series Max يمكنك توقّع نحو 38 توكِن في الثانية. نافذة السياق تبلغ 16K وهي متواضعة، لذا تعامل معها كمساحة عمل مؤقتة لا كمكان لإلقاء مستندات كاملة. حتى عند 8K من السياق يرتفع إجمالي استهلاك الذاكرة إلى نحو 10.5 GB، فاترك هامشاً على بطاقة بسعة 12 GB.
بالمقارنة مع أشقائه، يُعدّ Phi-4 14B و Qwen 3 14B الخياران الأفضل إذا أردت نموذجاً عاماً للدردشة والاستدلال، إذ يضحّي هذا البناء ببعض ذلك الاتساع مقابل فهم الصور. أما Phi-4 Mini 3.8B فهو الخيار الأخف حين تكون الذاكرة شحيحة. الميزة البارزة هنا أنك تحصل على استدلال متعدد الوسائط حقيقي ضمن حجم لا يزال يتسع لبطاقة رسوميات واحدة من الفئة المتوسطة، ورخصة MIT تعني أنه لا قيود تجارية تستدعي القلق.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.3 GB | 12 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 9.1 GB | 16 GB | موصى به |
| Q5_K_M | 5.65 | 10.6 GB | 16 GB | عالية |
| Q8_0 | 8.5 | 15.9 GB | 24 GB | شبه أصلية |
| F16 | 16 | 30.0 GB | 48 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.7 GB | ~9.8 GB |
| 8K رمز | ~1.4 GB | ~10.5 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~94 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~25 tok/s |
| Apple M-series Max | 410 GB/s | ~38 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.