← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen 2.5 Coder 32B?

O Qwen 2.5 Coder 32B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 19.9 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~18 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen 2.5 Coder 32B é o modelo de programação criado sob medida pela Alibaba, e é o que as pessoas escolhem quando querem um assistente local que realmente compete com ferramentas hospedadas em trabalho de programação de verdade. Com 32.8B de parâmetros, não é um download casual: um quant de 4 bits fica em torno de 19.9 GB, e você precisa de pelo menos 32 GB de RAM para carregá-lo. Isso descarta de vez uma RTX 3060 de 12 GB, onde ele simplesmente não cabe. Os lares realistas para ele são uma placa de 24 GB ou um Mac com Apple Silicon e bastante memória unificada.

No dia a dia ele parece mais comedido do que ágil, e a diferença de hardware aparece. Numa RTX 4090 dá para esperar cerca de 43 tokens por segundo em 4 bits, rápido o bastante para o código fluir confortavelmente enquanto você lê. Um M-series Max fica mais perto de 18 tokens por segundo, utilizável mas com um trabalho visivelmente mais paciente, e um fallback em CPU com DDR5 a cerca de 3 tokens por segundo serve mesmo só para tarefas em lote durante a noite. O contexto de 128K é genuinamente útil para alimentar arquivos inteiros, mas não sai de graça: forçar a janela completa empurra a memória total para perto de 51.6 GB, então mantenha o contexto de trabalho modesto a menos que você tenha folga.

Contra o DeepSeek R1 32B, que tem o mesmo tamanho de 32.8B, a diferença é de propósito: o R1 é um modelo de raciocínio que pensa em voz alta, enquanto o Qwen 2.5 Coder costuma ser mais direto e objetivo na geração e no completar de código puro. Seu traço de destaque é exatamente esse foco em programação num tamanho que você ainda consegue hospedar por conta própria em uma boa GPU. E a licença é a parte fácil: Apache 2.0 significa que você pode usá-lo livremente, inclusive comercialmente e em produção, sem amarras específicas de provedor.

Especificações

Parâmetros32.8B
Janela de contexto128K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2024-11
Ideal paraProgramação

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3513.7 GB24 GBPerda perceptível
Q4_K_MRecomendada4.8519.9 GB32 GBRecomendada
Q5_K_M5.6523.2 GB32 GBAlta
Q8_08.534.8 GB48 GBQuase original
F161665.6 GB96 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.0 GB~20.9 GB
8K tokens~2.0 GB~21.9 GB
32K tokens~7.9 GB~27.8 GB
128K tokens~31.7 GB~51.6 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen2.5-coder:32b

Perguntas frequentes

Requisitos de sistema do Qwen 2.5 Coder 32B — Posso rodar localmente?