Puis-je faire tourner QwQ 32B ?
QwQ 32B de Alibaba demande environ 32 GB de RAM avec la quantisation 4 bits recommandée (19.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~18 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
QwQ 32B est le spécialiste du raisonnement d'Alibaba, pas un modèle de chat généraliste, et ce cadrage compte avant de télécharger quoi que ce soit. C'est un modèle dense de 32,8 milliards de paramètres qui réfléchit à voix haute via de longues chaînes avant de répondre, ce qui le rend solide en maths et sur les problèmes à étapes multiples, mais lent et verbeux pour les questions rapides. En quantification 4 bits, il pèse environ 19.9 GB, donc la RTX 3060 de 12 GB ne pourra tout simplement pas le contenir. Concrètement, il faut 32 GB de mémoire système ou unifiée pour l'exécuter, ce qui le place sur des stations de travail, des GPU de 24 GB ou de l'Apple Silicon haut de gamme, plutôt que sur une carte de jeu classique.
À l'usage quotidien, il paraît posé plutôt que vif. Sur une RTX 4090, attendez-vous à environ 43 tokens par seconde en 4 bits, ce qui semble correct jusqu'à ce que vous vous rappeliez que ce modèle passe l'essentiel de ces tokens à raisonner avant d'atteindre une réponse : une seule requête difficile peut donc tourner un bon moment. Sur un Apple M Max, cela tombe à environ 18 tokens par seconde, et sur un CPU DDR5, cela rampe autour de 3 tokens par seconde. Le contexte de 128K est réel, mais le pousser à la limite fait grimper la mémoire totale autour de 51.6 GB, bien au-delà du plancher de 32 GB ; gardez donc un contexte de travail modeste, sauf si vous avez la marge.
Face à DeepSeek R1 32B, l'autre modèle de raisonnement dense en 32B ici, les deux sont proches en empreinte et en intention, et le gagnant dépend plutôt de la tâche précise que d'un net avantage généralisé : il vaut la peine d'essayer les deux. Si vous n'avez que quelques gigaoctets, les petits modèles de chat Qwen 3 0.6B ou 1.7B sont un outil complètement différent, parfaits pour des réponses rapides mais pas pour le raisonnement profond pour lequel QwQ est conçu. La grande force de QwQ est d'offrir un raisonnement pas à pas digne des modèles de pointe à une taille auto-hébergeable, et étant sous Apache 2.0, il est libre d'usage commercial sans contraintes de licence.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 19.9 GB | 32 GB | Recommandée |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Élevée |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Quasi originale |
| F16 | 16 | 65.6 GB | 96 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~20.9 GB |
| 8K tokens | ~2.0 GB | ~21.9 GB |
| 32K tokens | ~7.9 GB | ~27.8 GB |
| 128K tokens | ~31.7 GB | ~51.6 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run qwq