Posso rodar o Qwen 3.6 27B?
O Qwen 3.6 27B, da Alibaba, precisa de cerca de 24 GB de RAM na quantização recomendada de 4 bits (download de 16.4 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~21 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O Qwen 3.6 27B é o modelo de porte médio da Alibaba para quem quer um único modelo local capaz, que dá conta de chat, raciocínio, programação e imagens sem precisar recorrer à nuvem. É um modelo denso de 27B, ou seja, todos os parâmetros rodam em cada token, e isso aparece no consumo: um quant de 4-bit ocupa cerca de 16.4 GB e você precisa de uns 24 GB de RAM só para carregá-lo. Isso o deixa fora do alcance de uma placa de 12 GB como a RTX 3060, onde ele simplesmente não cabe, e bem no território de uma RTX 4090 de 24 GB ou de um Mac com Apple Silicon de memória mais alta.
Numa 4090 dá para esperar algo em torno de 52 tokens por segundo em 4-bit, o que aparece mais rápido do que você lê e parece de fato responsivo para um assistente interativo. Num M-series Max ele fica perto de 21 tok/s, ainda confortável para chat e programação. A janela de contexto de 256K é o número de destaque, mas trate-a como um teto, não como padrão. A memória sobe forte conforme você a preenche: com 128K de contexto o conjunto de trabalho completo chega a cerca de 45.4 GB, então, a menos que você tenha um setup nível workstation, mantenha o contexto do dia a dia modesto e reserve a janela longa para o trabalho raro que realmente precisa dela.
Contra o Gemma 3 27B, a outra opção óbvia de 27B, os dois se equivalem: o Gemma 3 cobre chat e visão, enquanto o Qwen 3.6 27B em geral acrescenta programação e raciocínio mais fortes a essa mesma base com capacidade de visão, o que o torna a escolha mais ampla se você quer um único modelo para tudo. Se a memória está apertada, o bem menor Qwen 3 1.7B é a alternativa realista, embora seja só de chat e não vá raciocinar nem enxergar imagens. O grande trunfo do Qwen 3.6 27B é a amplitude em um único modelo denso, e ele vem sob a licença Apache 2.0, então você pode usá-lo comercialmente e em produção sem preocupações de licença.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.3 GB | 16 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 16.4 GB | 24 GB | Recomendada |
| Q5_K_M | 5.65 | 19.1 GB | 32 GB | Alta |
| Q8_0 | 8.5 | 28.7 GB | 48 GB | Quase original |
| F16 | 16 | 54.0 GB | 96 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.9 GB | ~17.3 GB |
| 8K tokens | ~1.8 GB | ~18.2 GB |
| 32K tokens | ~7.3 GB | ~23.7 GB |
| 128K tokens | ~29.0 GB | ~45.4 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run qwen3.6:27bFontes e downloads