← جميع النماذجفحص النموذج

هل يمكنني تشغيل SmolLM2 1.7B؟

يحتاج SmolLM2 1.7B من Hugging Face إلى نحو 3 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 1.0 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~297 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

نموذج SmolLM2 1.7B مخصص للحالات التي يكون فيها Llama 8B مبالغًا فيه: نموذج محادثة صغير حقًا يمكنك تشغيله في أي مكان تقريبًا. بصيغة 4-bit يبلغ حجمه نحو 1 GB، ولا تحتاج سوى حوالي 3 GB من الذاكرة لتحميله مع مساحة عمل كافية، لذا يعمل على جهاز M1 Mac الأساسي، أو حاسوب محمول اقتصادي، أو لوحة من فئة Raspberry Pi، أو أي هاتف حديث به مساحة فائضة. وهو مرخّص بموجب Apache 2.0، ما يعني أنه يمكنك استخدامه تجاريًا وفي بيئة الإنتاج دون أي قيود من المزوّد. اعتبره النموذج الذي تُضمّنه في تطبيقاتك، لا النموذج الذي تجلس لتحادثه طوال اليوم.

في الاستخدام اليومي، يبرز معدل الإنتاجية الخام. على بطاقة RTX 3060 يعمل بسرعة تقارب 297 tok/s، ويصل على M Max إلى نحو 338، ويبلغ على 4090 حوالي 831، أي أسرع بكثير من قدرتك على القراءة. وحتى على معالج DDR5 عادي دون أي بطاقة رسومية، يحقق نحو 49 tok/s، وهو معدل صالح تمامًا للردود القصيرة. الحدّ الحقيقي هو نافذة السياق البالغة 8K. وهي صغيرة بمقاييس اليوم، لذا فهي مناسبة للأسئلة المفردة والتصنيف والملخصات القصيرة، لكنها لن تستوعب مستندًا طويلًا. أما الذاكرة فليست مشكلة هنا: حتى ملء كامل الـ 8K لا يتجاوز إجمالاً نحو 1.5 GB.

كن صادقًا حول ما يمنحه لك حجم 1.7B. فهو يتعامل مع المحادثة الخفيفة والتنسيق واتباع التعليمات البسيطة، لكنه يقصّر في الاستدلال متعدد الخطوات ومهام البرمجة الأطول. وعادةً ما يتفوّق عليه Qwen 3 1.7B في المطالبات الأصعب والمنظّمة، بينما يميل DeepSeek R1 1.5B إلى الأداء الأفضل حين تحتاج فعلًا إلى استدلال بسلسلة تفكير بدل الإجابات السريعة. وفي مقابل Llama 3.2 1B، يضحّي بقليل من الوزن الإضافي مقابل مخرجات أكثر ثباتًا. وأبرز ما يميّزه هو الكفاءة: مساعد مفتوح بالكامل وقابل للاستخدام تجاريًا يعمل بسرعة على عتاد لن يلمسه أي نموذج آخر بهذه القدرة. اختره حين تكون البصمة الصغيرة أهم من العمق.

المواصفات

المعاملات1.7B
نافذة السياق8K رمز
المطوِّرHugging Face
الرخصةApache 2.0
تاريخ الإصدار2024-11
الأفضل فيمحادثة

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.350.7 GB3 GBفقدان ملحوظ
Q4_K_Mموصى به4.851.0 GB3 GBموصى به
Q5_K_M5.651.2 GB3 GBعالية
Q8_08.51.8 GB4 GBشبه أصلية
F16163.4 GB6 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.3 GB~1.3 GB
8K رمز~0.5 GB~1.5 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run smollm2

الأسئلة الشائعة