← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Llama 3.2 3B ?

Llama 3.2 3B de Meta demande environ 4 GB de RAM avec la quantisation 4 bits recommandée (1.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~158 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Llama 3.2 3B, c'est le modèle vers lequel on se tourne quand on veut un vrai assistant sur une machine qui remarque à peine qu'il tourne. En quantification 4-bit, il pèse environ 1.9 GB et ne réclame qu'à peu près 4 GB de RAM : il tient donc sur quasiment n'importe quoi, un portable d'entrée de gamme, une carte de type Raspberry Pi avec assez de mémoire, un vieux GPU 6 GB, ou n'importe quel Mac Apple Silicon ayant un peu de marge. Si la famille 8B vous semble lourde pour votre matériel, c'est le cran en dessous qui garde un chat réellement utile.

À l'usage quotidien, ce qui frappe, c'est la vitesse. Sur une RTX 3060, comptez environ 158 tokens par seconde, et une 4090 grimpe à près de 442, soit bien plus vite que vous ne pouvez lire ; même un CPU DDR5 tient autour de 26 tok/s si vous n'avez pas de GPU du tout. La fenêtre de contexte de 128K est annoncée, mais restez réaliste côté mémoire : la remplir entièrement pousse l'usage total à environ 13 GB, bien au-delà de l'empreinte au repos du modèle. Sur les petites machines, limitez donc le contexte de travail à quelques milliers de tokens.

Face à sa propre famille, Llama 3.2 3B échange la profondeur contre la taille. Llama 3.1 8B gère en général mieux le raisonnement difficile et les instructions en plusieurs étapes, tandis que la déclinaison 1B ne s'impose que si vous êtes vraiment à court de mémoire et acceptez des réponses plus faibles. Le vrai atout du 3B, c'est d'être le plus petit Llama qui donne encore l'impression d'un partenaire de discussion compétent plutôt que d'un jouet. Une réserve : il est distribué sous licence Llama Community, qui est open-weight mais impose les conditions propres à Meta — ce n'est donc pas du vrai open-source. Vérifiez ces conditions avant de bâtir un produit dessus.

Caractéristiques

Paramètres3.2B
Fenêtre de contexte128K tokens
ÉditeurMeta
LicenceLlama Community
Sortie2024-09
Idéal pourChat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.351.3 GB4 GBPerte sensible
Q4_K_MRecommandée4.851.9 GB4 GBRecommandée
Q5_K_M5.652.3 GB6 GBÉlevée
Q8_08.53.4 GB6 GBQuasi originale
F16166.4 GB12 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.3 GB~2.2 GB
8K tokens~0.7 GB~2.6 GB
32K tokens~2.8 GB~4.7 GB
128K tokens~11.1 GB~13.0 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~158 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~442 tok/s
Apple M-series (base)100 GB/s~44 tok/s
Apple M-series Pro270 GB/s~118 tok/s
Apple M-series Max410 GB/s~180 tok/s
CPU only (dual-channel DDR5)60 GB/s~26 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run llama3.2

Questions fréquentes