← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen3-Next 80B-A3B?

O Qwen3-Next 80B-A3B, da Alibaba, precisa de cerca de 64 GB de RAM na quantização recomendada de 4 bits (download de 48.5 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~192 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen3-Next 80B-A3B é um modelo mixture-of-experts da Alibaba, e o número de destaque engana de um jeito útil: ele tem 80B de parâmetros no total, mas roteia apenas cerca de 3B por token. Na prática, ele gera texto na velocidade de um modelo minúsculo enquanto ainda recorre ao conhecimento de um modelo grande. O problema é a memória. Você ainda precisa manter tudo carregado em RAM ou VRAM, então mesmo num quant de 4 bits em torno de 48.5 GB você precisa de pelo menos 64 GB para rodá-lo, o que descarta GPUs de consumo isoladas e aponta para uma máquina com bastante memória.

Na prática, este é um modelo para Apple Silicon ou workstation, não para GPU de jogos. Num M Max com memória unificada suficiente, ele entrega cerca de 192 tokens por segundo, o que é genuinamente rápido para um modelo da classe 80B e a principal razão pela qual as pessoas o escolhem. Uma RTX 3060 de 12 GB ou uma RTX 4090 de 24 GB simplesmente não conseguem carregá-lo. Se você estiver na CPU com DDR5, ainda dá para rodá-lo a cerca de 28 tokens por segundo, mais lento, mas viável para tarefas em lote. O contexto de 256K é real, mas é faminto: avançar rumo a 128K pode levar a memória total para perto de 95.8 GB, então planeje uma folga antes de enchê-lo.

Contra o Llama 3.1 70B, a comparação densa óbvia, o Qwen3-Next tende a parecer bem mais rápido para o seu tamanho, porque apenas 3B de parâmetros ficam ativos a cada passo, enquanto o Llama precisa rodar todos os 70B. A qualidade em chat e raciocínio é competitiva, embora modelos densos de 70B ainda possam levar vantagem nos prompts de múltiplos passos mais difíceis. Seu traço marcante é essa relação velocidade-por-tamanho: a amplitude de um modelo grande com a latência de um pequeno, se você tiver memória para hospedá-lo. A licença é Apache 2.0, então você é livre para usá-lo comercialmente e em produção, sem amarras específicas do provedor.

Especificações

Parâmetros80B (3B ativos)
Janela de contexto256K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2025-09
Ideal paraChat, Raciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3533.5 GB48 GBPerda perceptível
Q4_K_MRecomendada4.8548.5 GB64 GBRecomendada
Q5_K_M5.6556.5 GB96 GBAlta
Q8_08.585.0 GB128 GBQuase original
F1616160.0 GB256 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.5 GB~50.0 GB
8K tokens~3.0 GB~51.5 GB
32K tokens~11.8 GB~60.3 GB
128K tokens~47.3 GB~95.8 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/sNão cabe na VRAM
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3-next:80b

Perguntas frequentes