Puis-je faire tourner Llama 3.1 8B ?
Llama 3.1 8B de Meta demande environ 8 GB de RAM avec la quantisation 4 bits recommandée (4.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~63 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Llama 3.1 8B, c'est le modèle que la plupart des gens ont réellement en tête quand ils disent vouloir "faire tourner un LLM en local". En quantification 4 bits, il pèse autour de 4.9 GB, ce qui lui permet de tenir sans souci sur un GPU de 8 GB, de loger largement dans la mémoire unifiée de n'importe quel Mac Apple Silicon depuis le M1, et même de s'exécuter sur CPU si vous êtes patient. C'est cette combinaison d'empreinte réduite et de sorties vraiment utiles qui en a fait le point de départ par défaut pour l'auto-hébergement.
À l'usage quotidien, il paraît rapide et cohérent pour le chat, le résumé et un peu d'aide au code. Sur un GPU moderne de milieu de gamme, vous pouvez tabler sur bien plus de 40 tokens par seconde en 4 bits, assez vite pour que la réponse défile plus rapidement que vous ne lisez. La fenêtre de contexte de 128K est réelle, mais traitez-la comme un plafond plutôt qu'une altitude de croisière : la remplir fait grimper fortement la mémoire du cache KV, donc sur une carte de 8 GB vous voudrez garder le contexte de travail à quelques milliers de tokens, sauf à descendre vers une quantification plus petite.
Là où sa taille se ressent, c'est sur le raisonnement et le suivi d'instructions des prompts plus durs, en plusieurs étapes : des modèles 7-8B plus récents comme Qwen 3 8B ont tendance à le devancer sur les maths et les tâches structurées, tandis que Gemma 3 4B est le choix plus léger si la mémoire est serrée. L'atout de Llama 3.1 8B, c'est sa maturité : il dispose du support d'outillage le plus large, du plus grand nombre de builds quantifiés sur Hugging Face et Ollama, et du moins de surprises. Si vous voulez un seul modèle qui fonctionne tout simplement comme assistant local, c'est encore le choix par défaut sûr.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 4.9 GB | 8 GB | Recommandée |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Élevée |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Quasi originale |
| F16 | 16 | 16.0 GB | 24 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.5 GB | ~5.4 GB |
| 8K tokens | ~1.0 GB | ~5.9 GB |
| 32K tokens | ~4.2 GB | ~9.1 GB |
| 128K tokens | ~16.8 GB | ~21.7 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run llama3.1Sources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Meta.
github.comMeta — page officielle
Page officielle et documentation de Meta.
llama.com