← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Qwen 3.5 27B ?

Qwen 3.5 27B de Alibaba demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (16.4 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~21 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Qwen 3.5 27B est le modèle vers lequel on se tourne quand un 8B paraît trop léger et qu'on dispose d'une vraie machine. C'est un modèle dense de 27B qui gère le chat, le raisonnement, le code et la vision : il fait donc office de cheval de bataille local plutôt que d'assistant limité à une seule tâche. Le hic, c'est l'empreinte mémoire : en 4 bits il pèse environ 16,4 GB, et il faut au moins 24 GB de RAM pour le charger proprement. Cela exclut une carte de 12 GB comme une RTX 3060, où il ne tient tout simplement pas, et vous oriente vers un GPU de 24 GB ou un Mac Apple Silicon doté d'une mémoire unifiée généreuse.

Sur une RTX 4090, comptez environ 52 tokens par seconde en 4 bits : ça défile plus vite que vous ne lisez et reste confortable pour un usage interactif. Sur un Mac M-series Max, on tombe autour de 21 tokens par seconde, encore correct pour le chat et le code mais plus lent sur les générations longues ; en pur CPU sur DDR5, on descend à environ 3 tokens par seconde, soit le territoire de la patience. Le contexte de 256K est le chiffre vedette, mais traitez-le comme un plafond : à 128K, la mémoire totale grimpe à environ 45,4 GB, donc sur une carte de 24 GB gardez votre contexte de travail bien en dessous du maximum.

La comparaison naturelle est Gemma 3 27B, l'autre modèle 27B à poids ouverts avec vision dans cette catégorie de taille. Gemma est généralement le choix le plus sûr si vous cherchez surtout un chat soigné et une bonne compréhension d'image, tandis que Qwen 3.5 27B se montre en règle générale plus fort sur le code et le raisonnement structuré, là où réside sa vraie valeur pour les développeurs. Le grand avantage pratique, c'est la licence : il est distribué sous Apache 2.0, ce qui vous permet de l'utiliser commercialement et en production sans contrainte propre au fournisseur, contrairement aux conditions de poids ouverts qui accompagnent Gemma.

Caractéristiques

Paramètres27B
Fenêtre de contexte256K tokens
ÉditeurAlibaba
LicenceApache 2.0
Sortie2026-02
Idéal pourChat, Raisonnement, Code, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3511.3 GB16 GBPerte sensible
Q4_K_MRecommandée4.8516.4 GB24 GBRecommandée
Q5_K_M5.6519.1 GB32 GBÉlevée
Q8_08.528.7 GB48 GBQuasi originale
F161654.0 GB96 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.9 GB~17.3 GB
8K tokens~1.8 GB~18.2 GB
32K tokens~7.3 GB~23.7 GB
128K tokens~29.0 GB~45.4 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~52 tok/s
Apple M-series (base)100 GB/s~5 tok/s
Apple M-series Pro270 GB/s~14 tok/s
Apple M-series Max410 GB/s~21 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run qwen3.5:27b

Questions fréquentes