Posso rodar o Qwen 2.5 Coder 32B?
O Qwen 2.5 Coder 32B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 19.9 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~18 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O Qwen 2.5 Coder 32B é o modelo de programação criado sob medida pela Alibaba, e é o que as pessoas escolhem quando querem um assistente local que realmente compete com ferramentas hospedadas em trabalho de programação de verdade. Com 32.8B de parâmetros, não é um download casual: um quant de 4 bits fica em torno de 19.9 GB, e você precisa de pelo menos 32 GB de RAM para carregá-lo. Isso descarta de vez uma RTX 3060 de 12 GB, onde ele simplesmente não cabe. Os lares realistas para ele são uma placa de 24 GB ou um Mac com Apple Silicon e bastante memória unificada.
No dia a dia ele parece mais comedido do que ágil, e a diferença de hardware aparece. Numa RTX 4090 dá para esperar cerca de 43 tokens por segundo em 4 bits, rápido o bastante para o código fluir confortavelmente enquanto você lê. Um M-series Max fica mais perto de 18 tokens por segundo, utilizável mas com um trabalho visivelmente mais paciente, e um fallback em CPU com DDR5 a cerca de 3 tokens por segundo serve mesmo só para tarefas em lote durante a noite. O contexto de 128K é genuinamente útil para alimentar arquivos inteiros, mas não sai de graça: forçar a janela completa empurra a memória total para perto de 51.6 GB, então mantenha o contexto de trabalho modesto a menos que você tenha folga.
Contra o DeepSeek R1 32B, que tem o mesmo tamanho de 32.8B, a diferença é de propósito: o R1 é um modelo de raciocínio que pensa em voz alta, enquanto o Qwen 2.5 Coder costuma ser mais direto e objetivo na geração e no completar de código puro. Seu traço de destaque é exatamente esse foco em programação num tamanho que você ainda consegue hospedar por conta própria em uma boa GPU. E a licença é a parte fácil: Apache 2.0 significa que você pode usá-lo livremente, inclusive comercialmente e em produção, sem amarras específicas de provedor.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 19.9 GB | 32 GB | Recomendada |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Alta |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Quase original |
| F16 | 16 | 65.6 GB | 96 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~20.9 GB |
| 8K tokens | ~2.0 GB | ~21.9 GB |
| 32K tokens | ~7.9 GB | ~27.8 GB |
| 128K tokens | ~31.7 GB | ~51.6 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run qwen2.5-coder:32bFontes e downloads