← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Qwen 3 8B ?

Qwen 3 8B de Alibaba demande environ 8 GB de RAM avec la quantisation 4 bits recommandée (5.0 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~62 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Qwen 3 8B, c'est le modele vers lequel on se tourne quand on veut un assistant local capable de vraiment reflechir un peu, et pas seulement de discuter. En 4-bit, il pese environ 5 GB, donc il tient sur un GPU de 8 GB, et le minimum de 8 GB de RAM signifie qu'un Mac Apple Silicon de base ou un PC de bureau modeste peut l'heberger sans souci. Son atout phare, c'est son mode de raisonnement hybride : il peut consacrer des tokens supplementaires a derouler un probleme avant de repondre, ce qui explique pourquoi on le prefere aux simples modeles de chat de la meme categorie 8B.

Au quotidien, il est rapide. Sur une RTX 3060 12GB, vous obtenez environ 62 tokens par seconde, sur un Mac M-series Max autour de 70, et une RTX 4090 le pousse a environ 172, le tout assez vite pour que les reponses devancent votre lecture. En CPU seul sur de la DDR5, on tombe a environ 10 tok/s : correct pour du traitement par lots, mais pas pour de l'interactif. Le contexte de 128K est bien reel, mais attention : le remplir entierement fait monter la memoire totale a environ 22 GB, bien au-dela des 8 GB d'une petite carte. Gardez donc un contexte de travail raisonnable, sauf si vous avez de la marge ou si vous passez a la version q2 de 3.4 GB.

Face a Granite 3.3 8B, un modele ouvert de taille comparable surtout oriente chat, Qwen 3 8B a generalement l'avantage sur le raisonnement en plusieurs etapes et les maths grace a son mode de reflexion, tandis que Granite parait plus conversationnel. Sa caracteristique marquante, c'est ce basculement vers le raisonnement dans un format aussi compact. Et la licence est la partie facile : Apache 2.0 signifie que vous pouvez l'utiliser commercialement et en production sans contrainte propre au fournisseur, ce qui est plus rare que ca ne devrait l'etre a cette taille.

Caractéristiques

Paramètres8.2B
Fenêtre de contexte128K tokens
ÉditeurAlibaba
LicenceApache 2.0
Sortie2025-04
Idéal pourChat, Raisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.353.4 GB6 GBPerte sensible
Q4_K_MRecommandée4.855.0 GB8 GBRecommandée
Q5_K_M5.655.8 GB12 GBÉlevée
Q8_08.58.7 GB16 GBQuasi originale
F161616.4 GB24 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.5 GB~5.5 GB
8K tokens~1.1 GB~6.1 GB
32K tokens~4.2 GB~9.2 GB
128K tokens~17.0 GB~22.0 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~62 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~172 tok/s
Apple M-series (base)100 GB/s~17 tok/s
Apple M-series Pro270 GB/s~46 tok/s
Apple M-series Max410 GB/s~70 tok/s
CPU only (dual-channel DDR5)60 GB/s~10 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run qwen3

Questions fréquentes

Configuration requise pour Qwen 3 8B — Puis-je le faire tourner en local ?