← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Qwen3-Next 80B-A3B ?

Qwen3-Next 80B-A3B de Alibaba demande environ 64 GB de RAM avec la quantisation 4 bits recommandée (48.5 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~192 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Qwen3-Next 80B-A3B est un modèle à mélange d'experts (MoE) signé Alibaba, et son chiffre phare induit en erreur, mais de façon utile : il compte 80B de paramètres au total, mais n'en active qu'environ 3B par token. Résultat, il génère à la vitesse d'un petit modèle tout en puisant dans les connaissances d'un grand. Le hic, c'est la mémoire. Vous devez tout de même charger l'ensemble en RAM ou en VRAM : même en quantification 4-bit, autour de 48.5 GB, il faut au moins 64 GB pour le faire tourner, ce qui exclut les GPU grand public seuls et oriente plutôt vers une machine à grande mémoire.

En pratique, c'est un modèle pour Apple Silicon ou station de travail, pas pour GPU de jeu. Sur un M Max doté de suffisamment de mémoire unifiée, il débite environ 192 tokens par seconde, ce qui est franchement rapide pour un modèle de classe 80B et la principale raison de le choisir. Une RTX 3060 de 12 GB ou une RTX 4090 de 24 GB ne peuvent tout simplement pas le charger. Sur CPU avec de la DDR5, vous pouvez encore l'exécuter à environ 28 tokens par seconde : plus lent, mais exploitable pour des traitements par lots. Le contexte de 256K est réel, mais gourmand : monter vers 128K peut porter la mémoire totale autour de 95.8 GB, prévoyez donc de la marge avant de le saturer.

Face à Llama 3.1 70B, la comparaison dense évidente, Qwen3-Next paraît nettement plus rapide pour sa taille, car seuls 3B de paramètres sont actifs à chaque étape là où le Llama doit faire tourner ses 70B. La qualité en conversation et en raisonnement est compétitive, même si les modèles denses de 70B conservent parfois un avantage sur les requêtes multi-étapes les plus difficiles. Son atout majeur reste ce rapport vitesse/taille : l'étendue d'un grand modèle avec la latence d'un petit, à condition d'avoir la mémoire pour l'héberger. La licence est Apache 2.0, vous êtes donc libre de l'utiliser à des fins commerciales et en production sans contraintes propres au fournisseur.

Caractéristiques

Paramètres80B (3B actifs)
Fenêtre de contexte256K tokens
ÉditeurAlibaba
LicenceApache 2.0
Sortie2025-09
Idéal pourChat, Raisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3533.5 GB48 GBPerte sensible
Q4_K_MRecommandée4.8548.5 GB64 GBRecommandée
Q5_K_M5.6556.5 GB96 GBÉlevée
Q8_08.585.0 GB128 GBQuasi originale
F1616160.0 GB256 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~1.5 GB~50.0 GB
8K tokens~3.0 GB~51.5 GB
32K tokens~11.8 GB~60.3 GB
128K tokens~47.3 GB~95.8 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/sNe tient pas dans la VRAM
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run qwen3-next:80b

Questions fréquentes

Configuration requise pour Qwen3-Next 80B-A3B — Puis-je le faire tourner en local ?