Puis-je faire tourner Qwen 3.6 27B ?
Qwen 3.6 27B de Alibaba demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (16.4 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~21 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
Qwen 3.6 27B est le modèle polyvalent de milieu de gamme d'Alibaba, pensé pour ceux qui veulent un seul modèle local capable de gérer le chat, le raisonnement, le code et les images sans passer par le cloud. C'est un modèle dense de 27B : chaque paramètre tourne sur chaque token, et ça se voit dans l'empreinte mémoire. Une quantification 4-bit pèse environ 16.4 GB et il faut autour de 24 GB de RAM rien que pour le charger. Autant dire qu'il est hors de portée d'une carte de 12 GB comme la RTX 3060, où il ne tient tout simplement pas, et qu'il vise plutôt une RTX 4090 de 24 GB ou un Mac Apple Silicon doté de beaucoup de mémoire.
Sur une 4090, comptez environ 52 tokens par seconde en 4-bit : le texte défile plus vite que vous ne le lisez et le ressenti est vraiment réactif pour un assistant interactif. Sur un Max de la série M, on tombe autour de 21 tok/s, ce qui reste confortable pour le chat et le code. La fenêtre de contexte de 256K est le chiffre qui fait la une, mais voyez-la comme un plafond, pas comme une valeur par défaut. La mémoire grimpe vite à mesure que vous la remplissez : à 128K de contexte, l'empreinte de travail atteint environ 45.4 GB. À moins de disposer d'une configuration de niveau station de travail, gardez un contexte modeste au quotidien et réservez la longue fenêtre aux rares tâches qui en ont réellement besoin.
Face à Gemma 3 27B, l'autre option évidente en 27B, les deux se renvoient la balle : Gemma 3 couvre le chat et la vision, tandis que Qwen 3.6 27B ajoute en général un code et un raisonnement plus solides à cette même base capable de vision, ce qui en fait le choix le plus large si vous voulez un seul modèle pour tout faire. Si la mémoire vous manque, le bien plus petit Qwen 3 1.7B est le repli réaliste, même s'il se limite au chat et ne sait ni raisonner ni voir les images. La grande force de Qwen 3.6 27B, c'est cette polyvalence dans un unique modèle dense, et il est distribué sous licence Apache 2.0 : vous pouvez donc l'utiliser commercialement et en production sans vous soucier des contraintes de licence.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.3 GB | 16 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 16.4 GB | 24 GB | Recommandée |
| Q5_K_M | 5.65 | 19.1 GB | 32 GB | Élevée |
| Q8_0 | 8.5 | 28.7 GB | 48 GB | Quasi originale |
| F16 | 16 | 54.0 GB | 96 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.9 GB | ~17.3 GB |
| 8K tokens | ~1.8 GB | ~18.2 GB |
| 32K tokens | ~7.3 GB | ~23.7 GB |
| 128K tokens | ~29.0 GB | ~45.4 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run qwen3.6:27bSources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Alibaba.
github.comAlibaba — page officielle
Page officielle et documentation de Alibaba.
qwen.ai