← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen 3.6 35B-A3B?

O Qwen 3.6 35B-A3B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 21.2 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~192 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen 3.6 35B-A3B é um modelo mixture-of-experts, e é justamente isso que define para quem ele serve. São 35B de parâmetros no total, mas apenas 3B ativos por token, então ele roda na velocidade de um modelo minúsculo enquanto exige a memória de um grande. Com quantização de 4 bits, os pesos ficam em torno de 21.2 GB, mas o modelo ainda precisa de no mínimo cerca de 32 GB de RAM para manter o conjunto completo de experts. Isso descarta uma placa de 12 GB como a RTX 3060, na qual ele não cabe. O lar natural dele é uma RTX 4090 de 24 GB ou um Mac com Apple Silicon e bastante memória unificada.

No uso diário, a conta dos 3B ativos compensa: numa 4090 você vê cerca de 471 tokens por segundo, e num M-series Max por volta de 192, mais rápido que a maioria dos modelos densos com um terço deste tamanho. Até a inferência em CPU com DDR5 chega a uns 28 tokens por segundo, viável para processamento em lote. Ele dá conta de chat, raciocínio, programação e visão, então se justifica como um único modelo local faz-tudo. A janela de contexto de 256K é generosa, mas a pegadinha é a memória: preencher só 128K já leva o consumo total para cerca de 53.8 GB, então trabalho com contexto longo pede uma máquina de 64 GB, não uma placa de 24 GB.

Comparado ao denso Command R 35B da mesma linhagem, este MoE em geral parece bem mais rápido no mesmo tamanho nominal, já que você paga pela memória de 35B mas computa como um 3B. O custo é o trade-off típico de MoE: um denso de 35B pode às vezes levar vantagem no raciocínio single-shot mais difícil, embora para a maior parte do trabalho a velocidade vença. Seu traço de destaque é essa relação entre velocidade e capacidade, somada à visão nativa num só pacote. A licença é Apache 2.0, então você é livre para usá-lo comercialmente e em produção, sem amarras do provedor.

Especificações

Parâmetros35B (3B ativos)
Janela de contexto256K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2026-04
Ideal paraChat, Raciocínio, Programação, Visão

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3514.7 GB24 GBPerda perceptível
Q4_K_MRecomendada4.8521.2 GB32 GBRecomendada
Q5_K_M5.6524.7 GB48 GBAlta
Q8_08.537.2 GB48 GBQuase original
F161670.0 GB96 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.0 GB~22.2 GB
8K tokens~2.0 GB~23.2 GB
32K tokens~8.1 GB~29.3 GB
128K tokens~32.6 GB~53.8 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3.6:35b

Perguntas frequentes

Requisitos de sistema do Qwen 3.6 35B-A3B — Posso rodar localmente?