← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen 3 30B-A3B?

O Qwen 3 30B-A3B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 18.5 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~174 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen 3 30B-A3B é um modelo mixture-of-experts, e esse único detalhe define tudo na forma como você deve pensar nele. No papel são 30.5B de parâmetros, mas apenas 3.3B ativam por token, então ele roda na velocidade de um modelo pequeno enquanto raciocina com a amplitude de um grande. O problema é a memória: você ainda precisa manter o modelo inteiro na RAM. Um quant de 4 bits ocupa cerca de 18.5 GB e o modelo pede pelo menos 32 GB para respirar, o que descarta uma placa de 12 GB como a RTX 3060, mas cabe confortavelmente em um Mac Apple Silicon de 32 GB, ou em uma 4090 de 24 GB se você mantiver o contexto modesto.

No uso diário, o design MoE compensa de um jeito que a ficha técnica não revela. Em uma 4090 você vê cerca de 428 tokens por segundo, e até um M-series Max se mantém ágil em torno de 174 tok/s, muito mais rápido do que um 30B denso jamais conseguiria no mesmo hardware. Só na CPU com DDR5 a taxa cai para uns 25 tok/s, útil para tarefas em lote, mas não para chat interativo. O contexto de 128K é real, mas fique de olho no orçamento: preenchê-lo empurra a memória total para cerca de 49.1 GB, então em uma máquina de 32 GB você mantém o contexto de trabalho modesto e aposta em um quant menor em vez de perseguir a janela inteira.

Contra o Gemma 4 31B, que fica em quase idênticos 30.7B de parâmetros, a troca é clara. O Gemma é denso e adiciona código e visão, então tende a se sair melhor em trabalho multimodal e em código estruturado, enquanto o design esparso do Qwen 3 30B-A3B o torna drasticamente mais rápido por token para chat e raciocínio nessa faixa de tamanho. Essa velocidade em relação ao seu tamanho é seu traço de destaque. Ele também vem sob a licença Apache 2.0, então, ao contrário de termos open-weight específicos de cada provedor, você pode usá-lo livremente em trabalho comercial e em produção, sem asteriscos de licenciamento.

Especificações

Parâmetros30.5B (3.3B ativos)
Janela de contexto128K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2025-04
Ideal paraChat, Raciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3512.8 GB24 GBPerda perceptível
Q4_K_MRecomendada4.8518.5 GB32 GBRecomendada
Q5_K_M5.6521.5 GB32 GBAlta
Q8_08.532.4 GB48 GBQuase original
F161661.0 GB96 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.0 GB~19.5 GB
8K tokens~1.9 GB~20.4 GB
32K tokens~7.7 GB~26.2 GB
128K tokens~30.6 GB~49.1 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/s~428 tok/s
Apple M-series (base)100 GB/s~42 tok/s
Apple M-series Pro270 GB/s~115 tok/s
Apple M-series Max410 GB/s~174 tok/s
CPU only (dual-channel DDR5)60 GB/s~25 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3:30b

Perguntas frequentes