← جميع النماذجفحص النموذج

هل يمكنني تشغيل Llama 3.2 3B؟

يحتاج Llama 3.2 3B من Meta إلى نحو 4 GB من RAM عند التكميم الموصى به بدقة 4 بت (تنزيل بحجم 1.9 GB). نفحص عتاد جهازك أدناه — فوراً، ولا شيء يغادر متصفحك. توقّع نحو ~158 tok/s على NVIDIA RTX 3060 12GB.

نقرأ مؤشرات عتاد جهازك…

ملاحظات من الواقع

Llama 3.2 3B هو النموذج الذي تلجأ إليه عندما تريد مساعدًا حقيقيًا على عتادٍ لا يكاد يشعر بتشغيله. بكمٍّ من 4-bit يصل حجمه إلى نحو 1.9 GB، ولا يطلب سوى حوالي 4 GB من ذاكرة RAM، فيتسع عمليًا لأي جهاز تقريبًا: حاسوب محمول من فئة المبتدئين، أو لوحة من صنف Raspberry بذاكرة كافية، أو بطاقة GPU قديمة بسعة 6 GB، أو أي جهاز Apple Silicon Mac فيه مساحة فائضة. إذا بدت لك عائلة 8B ثقيلة على جهازك، فهذه هي الدرجة الأدنى التي تُبقي المحادثة مفيدة فعلًا.

في الاستخدام اليومي، الميزة البارزة هي السرعة. على بطاقة RTX 3060 يمكنك توقع نحو 158 token في الثانية، بينما تدفع بطاقة 4090 هذا الرقم إلى حوالي 442، وهو أسرع بكثير من قدرتك على القراءة؛ وحتى معالج CPU بذاكرة DDR5 يحقق نحو 26 tok/s إن لم يكن لديك أي GPU إطلاقًا. نافذة السياق المذكورة هي 128K، لكن كن واقعيًا بشأن الذاكرة: ملؤها بالكامل يرفع الاستهلاك الإجمالي إلى نحو 13 GB، أي أبعد بكثير من البصمة الأساسية للنموذج في وضع الخمول، لذا أبقِ سياق العمل في حدود بضعة آلاف من الـ token على الأجهزة الصغيرة.

في مواجهة عائلته نفسها، يتنازل Llama 3.2 3B عن العمق مقابل الصِّغر. فعادةً ما يتعامل Llama 3.1 8B بشكل أفضل مع الاستدلال الأصعب والتعليمات متعددة الخطوات، بينما يكون الشقيق 1B خيارًا فقط حين تكون في ضائقة حقيقية مع الذاكرة وتقبل بإجابات أضعف. السمة الحقيقية لـ 3B أنه أصغر Llama لا يزال يبدو رفيق محادثة كفؤًا لا مجرد لعبة. تنبيه واحد: يأتي بترخيص Llama Community، وهو مفتوح الأوزان (open-weight) لكنه يحمل شروط Meta الخاصة، لذا فهو ليس مفتوح المصدر بالمعنى المجرّد. راجع تلك الشروط قبل بناء منتج عليه.

المواصفات

المعاملات3.2B
نافذة السياق128K رمز
المطوِّرMeta
الرخصةLlama Community
تاريخ الإصدار2024-09
الأفضل فيمحادثة

الحجم حسب التكميم

التكميمبت/وزنحجم التنزيلالحد الأدنى من RAMالجودة
Q2_K3.351.3 GB4 GBفقدان ملحوظ
Q4_K_Mموصى به4.851.9 GB4 GBموصى به
Q5_K_M5.652.3 GB6 GBعالية
Q8_08.53.4 GB6 GBشبه أصلية
F16166.4 GB12 GBأصلية

الأحجام تقديرات محسوبة من عدد المعاملات × عدد البتات لكل وزن؛ وتختلف نسخ GGUF الفعلية قليلاً. · آخر تحديث للبيانات: 2026-06-11 · كيف نحسب هذه الأرقام →

الذاكرة المطلوبة حسب طول السياق

السياقذاكرة KV cache (تقديرياً)إجمالي الذاكرة (Q4)
4K رمز~0.3 GB~2.2 GB
8K رمز~0.7 GB~2.6 GB
32K رمز~2.8 GB~4.7 GB
128K رمز~11.1 GB~13.0 GB

تنمو ذاكرة KV cache مع طول السياق — فالنموذج الذي يتسع عند 4K قد تنفد ذاكرته عند 32K. التقديرات تفترض ذاكرة تخزين بدقة FP16 مع grouped-query attention؛ ويختلف الاستهلاك الفعلي حسب بيئة التشغيل.

السرعة التقديرية حسب العتاد

العتادعرض النطاقالسرعة التقريبية
NVIDIA RTX 3060 12GB360 GB/s~158 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~442 tok/s
Apple M-series (base)100 GB/s~44 tok/s
Apple M-series Pro270 GB/s~118 tok/s
Apple M-series Max410 GB/s~180 tok/s
CPU only (dual-channel DDR5)60 GB/s~26 tok/s

توليد الرموز محكوم بعرض نطاق الذاكرة: tok/s ≈ عرض النطاق × 0.85 ÷ حجم النموذج عند Q4. وتختلف الأرقام الفعلية حسب بيئة التشغيل وطول السياق.

شغّله محلياً

أسهل طريق هو Ollama — أمر واحد وتبدأ المحادثة:

ollama run llama3.2

الأسئلة الشائعة