← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Llama 3.2 1B ?

Llama 3.2 1B de Meta demande environ 3 GB de RAM avec la quantisation 4 bits recommandée (0.7 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~421 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Llama 3.2 1B est le modèle vers lequel on se tourne quand on veut du local capable de tourner sur presque n'importe quoi. Avec 1.2B de paramètres, il est minuscule, et une quantification 4-bit pèse autour de 0.7 GB : il tient dans la mémoire d'un appareil de classe smartphone, ne gêne en rien une tablette ou un portable d'entrée de gamme, et ne réclame qu'environ 3 GB de RAM pour tourner confortablement. C'est le modèle du chat embarqué, de la rédaction simple et des assistants intégrés, là où chaque gigaoctet compte et où l'on ne peut pas présupposer la présence d'un GPU.

À l'usage quotidien, l'argument phare est la vitesse brute. Sur une RTX 3060, vous verrez environ 421 tokens par seconde, et même un CPU sur DDR5 tient le rythme autour de 70 tok/s, assez rapide pour paraître instantané sur des réponses courtes. La fenêtre de contexte de 128K est le piège : elle est techniquement là, mais la remplir pousse la mémoire totale vers 7.8 GB, ce qui annule tout l'intérêt d'un modèle aussi léger. Gardez le contexte de travail à quelques milliers de tokens et il reste le poids plume que vous étiez venu chercher.

Soyez honnête sur ses limites : à cette taille, il gère bien le chat court et bien cadré, mais perd le fil sur le raisonnement multi-étapes, les instructions longues et tout ce qui ressemble à du code. Si vous avez la marge, Llama 3.2 3B suit généralement mieux les prompts complexes, et Gemma 3 1B est l'alternative naturelle dans la même catégorie de poids. La grande force du 1B, c'est sa portée : il tourne là où des modèles plus gros ne le peuvent tout simplement pas. Une réserve côté licence : il est livré sous la licence Llama Community, à poids ouverts mais assortie des conditions propres à Meta, alors vérifiez-les avant de l'intégrer dans un produit.

Caractéristiques

Paramètres1.2B
Fenêtre de contexte128K tokens
ÉditeurMeta
LicenceLlama Community
Sortie2024-09
Idéal pourChat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.350.5 GB3 GBPerte sensible
Q4_K_MRecommandée4.850.7 GB3 GBRecommandée
Q5_K_M5.650.8 GB3 GBÉlevée
Q8_08.51.3 GB4 GBQuasi originale
F16162.4 GB6 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.2 GB~0.9 GB
8K tokens~0.4 GB~1.1 GB
32K tokens~1.8 GB~2.5 GB
128K tokens~7.1 GB~7.8 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~421 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~1178 tok/s
Apple M-series (base)100 GB/s~117 tok/s
Apple M-series Pro270 GB/s~315 tok/s
Apple M-series Max410 GB/s~479 tok/s
CPU only (dual-channel DDR5)60 GB/s~70 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run llama3.2:1b

Questions fréquentes

Configuration requise pour Llama 3.2 1B — Puis-je le faire tourner en local ?