هل يمكنني تشغيل SmolLM2 1.7B؟
يحتاج SmolLM2 1.7B من Hugging Face إلى نحو 3 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 1.0 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~297 tok/s على NVIDIA RTX 3060 12GB.
نقرأ مؤشرات عتاد جهازك…
ملاحظات من الواقع
نموذج SmolLM2 1.7B مخصص للحالات التي يكون فيها Llama 8B مبالغًا فيه: نموذج محادثة صغير حقًا يمكنك تشغيله في أي مكان تقريبًا. بصيغة 4-bit يبلغ حجمه نحو 1 GB، ولا تحتاج سوى حوالي 3 GB من الذاكرة لتحميله مع مساحة عمل كافية، لذا يعمل على جهاز M1 Mac الأساسي، أو حاسوب محمول اقتصادي، أو لوحة من فئة Raspberry Pi، أو أي هاتف حديث به مساحة فائضة. وهو مرخّص بموجب Apache 2.0، ما يعني أنه يمكنك استخدامه تجاريًا وفي بيئة الإنتاج دون أي قيود من المزوّد. اعتبره النموذج الذي تُضمّنه في تطبيقاتك، لا النموذج الذي تجلس لتحادثه طوال اليوم.
في الاستخدام اليومي، يبرز معدل الإنتاجية الخام. على بطاقة RTX 3060 يعمل بسرعة تقارب 297 tok/s، ويصل على M Max إلى نحو 338، ويبلغ على 4090 حوالي 831، أي أسرع بكثير من قدرتك على القراءة. وحتى على معالج DDR5 عادي دون أي بطاقة رسومية، يحقق نحو 49 tok/s، وهو معدل صالح تمامًا للردود القصيرة. الحدّ الحقيقي هو نافذة السياق البالغة 8K. وهي صغيرة بمقاييس اليوم، لذا فهي مناسبة للأسئلة المفردة والتصنيف والملخصات القصيرة، لكنها لن تستوعب مستندًا طويلًا. أما الذاكرة فليست مشكلة هنا: حتى ملء كامل الـ 8K لا يتجاوز إجمالاً نحو 1.5 GB.
كن صادقًا حول ما يمنحه لك حجم 1.7B. فهو يتعامل مع المحادثة الخفيفة والتنسيق واتباع التعليمات البسيطة، لكنه يقصّر في الاستدلال متعدد الخطوات ومهام البرمجة الأطول. وعادةً ما يتفوّق عليه Qwen 3 1.7B في المطالبات الأصعب والمنظّمة، بينما يميل DeepSeek R1 1.5B إلى الأداء الأفضل حين تحتاج فعلًا إلى استدلال بسلسلة تفكير بدل الإجابات السريعة. وفي مقابل Llama 3.2 1B، يضحّي بقليل من الوزن الإضافي مقابل مخرجات أكثر ثباتًا. وأبرز ما يميّزه هو الكفاءة: مساعد مفتوح بالكامل وقابل للاستخدام تجاريًا يعمل بسرعة على عتاد لن يلمسه أي نموذج آخر بهذه القدرة. اختره حين تكون البصمة الصغيرة أهم من العمق.
المواصفات
الحجم حسب التكميم
| التكميم | بت/وزن | حجم التنزيل | الحد الأدنى من RAM | الجودة |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | فقدان ملحوظ |
| Q4_K_Mموصى به | 4.85 | 1.0 GB | 3 GB | موصى به |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | عالية |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | شبه أصلية |
| F16 | 16 | 3.4 GB | 6 GB | أصلية |
الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →
الذاكرة المطلوبة حسب طول السياق
| السياق | ذاكرة KV cache (تقديرياً) | إجمالي الذاكرة (Q4) |
|---|---|---|
| 4K رمز | ~0.3 GB | ~1.3 GB |
| 8K رمز | ~0.5 GB | ~1.5 GB |
تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.
السرعة التقديرية حسب العتاد
| العتاد | عرض النطاق | السرعة التقريبية |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.
شغّله محلياً
أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:
ollama run smollm2