Puis-je faire tourner Qwen3-Next 80B-A3B ?
Qwen3-Next 80B-A3B de Alibaba demande environ 64 GB de RAM avec la quantisation 4 bits recommandée (48.5 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~192 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
Qwen3-Next 80B-A3B est un modèle à mélange d'experts (MoE) signé Alibaba, et son chiffre phare induit en erreur, mais de façon utile : il compte 80B de paramètres au total, mais n'en active qu'environ 3B par token. Résultat, il génère à la vitesse d'un petit modèle tout en puisant dans les connaissances d'un grand. Le hic, c'est la mémoire. Vous devez tout de même charger l'ensemble en RAM ou en VRAM : même en quantification 4-bit, autour de 48.5 GB, il faut au moins 64 GB pour le faire tourner, ce qui exclut les GPU grand public seuls et oriente plutôt vers une machine à grande mémoire.
En pratique, c'est un modèle pour Apple Silicon ou station de travail, pas pour GPU de jeu. Sur un M Max doté de suffisamment de mémoire unifiée, il débite environ 192 tokens par seconde, ce qui est franchement rapide pour un modèle de classe 80B et la principale raison de le choisir. Une RTX 3060 de 12 GB ou une RTX 4090 de 24 GB ne peuvent tout simplement pas le charger. Sur CPU avec de la DDR5, vous pouvez encore l'exécuter à environ 28 tokens par seconde : plus lent, mais exploitable pour des traitements par lots. Le contexte de 256K est réel, mais gourmand : monter vers 128K peut porter la mémoire totale autour de 95.8 GB, prévoyez donc de la marge avant de le saturer.
Face à Llama 3.1 70B, la comparaison dense évidente, Qwen3-Next paraît nettement plus rapide pour sa taille, car seuls 3B de paramètres sont actifs à chaque étape là où le Llama doit faire tourner ses 70B. La qualité en conversation et en raisonnement est compétitive, même si les modèles denses de 70B conservent parfois un avantage sur les requêtes multi-étapes les plus difficiles. Son atout majeur reste ce rapport vitesse/taille : l'étendue d'un grand modèle avec la latence d'un petit, à condition d'avoir la mémoire pour l'héberger. La licence est Apache 2.0, vous êtes donc libre de l'utiliser à des fins commerciales et en production sans contraintes propres au fournisseur.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 33.5 GB | 48 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 48.5 GB | 64 GB | Recommandée |
| Q5_K_M | 5.65 | 56.5 GB | 96 GB | Élevée |
| Q8_0 | 8.5 | 85.0 GB | 128 GB | Quasi originale |
| F16 | 16 | 160.0 GB | 256 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~1.5 GB | ~50.0 GB |
| 8K tokens | ~3.0 GB | ~51.5 GB |
| 32K tokens | ~11.8 GB | ~60.3 GB |
| 128K tokens | ~47.3 GB | ~95.8 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Ne tient pas dans la VRAM |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run qwen3-next:80b