Puis-je faire tourner Qwen 3 8B ?
Qwen 3 8B de Alibaba demande environ 8 GB de RAM avec la quantisation 4 bits recommandée (5.0 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~62 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Qwen 3 8B, c'est le modele vers lequel on se tourne quand on veut un assistant local capable de vraiment reflechir un peu, et pas seulement de discuter. En 4-bit, il pese environ 5 GB, donc il tient sur un GPU de 8 GB, et le minimum de 8 GB de RAM signifie qu'un Mac Apple Silicon de base ou un PC de bureau modeste peut l'heberger sans souci. Son atout phare, c'est son mode de raisonnement hybride : il peut consacrer des tokens supplementaires a derouler un probleme avant de repondre, ce qui explique pourquoi on le prefere aux simples modeles de chat de la meme categorie 8B.
Au quotidien, il est rapide. Sur une RTX 3060 12GB, vous obtenez environ 62 tokens par seconde, sur un Mac M-series Max autour de 70, et une RTX 4090 le pousse a environ 172, le tout assez vite pour que les reponses devancent votre lecture. En CPU seul sur de la DDR5, on tombe a environ 10 tok/s : correct pour du traitement par lots, mais pas pour de l'interactif. Le contexte de 128K est bien reel, mais attention : le remplir entierement fait monter la memoire totale a environ 22 GB, bien au-dela des 8 GB d'une petite carte. Gardez donc un contexte de travail raisonnable, sauf si vous avez de la marge ou si vous passez a la version q2 de 3.4 GB.
Face a Granite 3.3 8B, un modele ouvert de taille comparable surtout oriente chat, Qwen 3 8B a generalement l'avantage sur le raisonnement en plusieurs etapes et les maths grace a son mode de reflexion, tandis que Granite parait plus conversationnel. Sa caracteristique marquante, c'est ce basculement vers le raisonnement dans un format aussi compact. Et la licence est la partie facile : Apache 2.0 signifie que vous pouvez l'utiliser commercialement et en production sans contrainte propre au fournisseur, ce qui est plus rare que ca ne devrait l'etre a cette taille.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 5.0 GB | 8 GB | Recommandée |
| Q5_K_M | 5.65 | 5.8 GB | 12 GB | Élevée |
| Q8_0 | 8.5 | 8.7 GB | 16 GB | Quasi originale |
| F16 | 16 | 16.4 GB | 24 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.5 GB | ~5.5 GB |
| 8K tokens | ~1.1 GB | ~6.1 GB |
| 32K tokens | ~4.2 GB | ~9.2 GB |
| 128K tokens | ~17.0 GB | ~22.0 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~62 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~172 tok/s |
| Apple M-series (base) | 100 GB/s | ~17 tok/s |
| Apple M-series Pro | 270 GB/s | ~46 tok/s |
| Apple M-series Max | 410 GB/s | ~70 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~10 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run qwen3Sources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Alibaba.
github.comAlibaba — page officielle
Page officielle et documentation de Alibaba.
qwen.ai