← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen 3.5 9B?

O Qwen 3.5 9B, da Alibaba, precisa de cerca de 12 GB de RAM na quantização recomendada de 4 bits (download de 5.5 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~56 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen 3.5 9B é o generalista da Alibaba lançado no início de 2026, e o ponto interessante é que ele lida com visão além de chat e raciocínio, não só com texto. Em quantização de 4 bits, fica em torno de 5.5 GB, o que é um encaixe apertado mas viável numa GPU de 12 GB e cabe com folga na memória unificada de um Mac com Apple Silicon. Se você quiser espremer o modelo em algo menor, dá para baixar para uma build de 2 bits com cerca de 3.8 GB, mas você paga por isso em qualidade. Conte com uns 12 GB de RAM de sistema como piso prático.

No uso diário, ele parece rápido. Numa RTX 3060, dá para esperar cerca de 56 tokens por segundo em 4 bits, e um M-series Max chega a aproximadamente 64, ambos mais rápidos do que você lê. Uma RTX 4090 dispara para cerca de 157 tok/s, se você tiver uma. A janela de contexto de 256K é o número de destaque, mas seja realista quanto à memória: mesmo em 128K de contexto, o consumo total sobe para cerca de 23.2 GB, o que extrapola bastante uma placa de 12 GB. Mantenha o contexto de trabalho modesto, a menos que tenha uma GPU de 24 GB sobrando.

Dentro da própria família, o posicionamento é claro: os modelos Qwen 3 0.6B e 1.7B são peso-pena só para chat, voltados a hardware limitado, enquanto este 9B é aquele que você escolhe quando quer raciocínio e compreensão de imagens no mesmo modelo. O GLM-4.6V-Flash é a alternativa comparável com suporte a visão no mesmo porte, e os dois costumam se equilibrar dependendo da tarefa. O traço de destaque do Qwen 3.5 9B é a amplitude em um único download, e a licença Apache 2.0 significa que você pode usá-lo comercialmente sem amarras.

Especificações

Parâmetros9B
Janela de contexto256K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2026-03
Ideal paraChat, Raciocínio, Visão

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.353.8 GB8 GBPerda perceptível
Q4_K_MRecomendada4.855.5 GB12 GBRecomendada
Q5_K_M5.656.4 GB12 GBAlta
Q8_08.59.6 GB16 GBQuase original
F161618.0 GB24 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.6 GB~6.1 GB
8K tokens~1.1 GB~6.6 GB
32K tokens~4.4 GB~9.9 GB
128K tokens~17.7 GB~23.2 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~56 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~157 tok/s
Apple M-series (base)100 GB/s~16 tok/s
Apple M-series Pro270 GB/s~42 tok/s
Apple M-series Max410 GB/s~64 tok/s
CPU only (dual-channel DDR5)60 GB/s~9 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3.5:9b

Perguntas frequentes

Requisitos de sistema do Qwen 3.5 9B — Posso rodar localmente?