Posso rodar o DeepSeek R1 32B?
O DeepSeek R1 32B, da DeepSeek, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 19.9 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~18 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O DeepSeek R1 32B é um modelo de raciocínio para quem quer rodar cadeia de pensamento localmente, e não um bate-papo rápido. Com 32.8B de parâmetros, não é um download casual: um quant de 4 bits ocupa cerca de 19.9 GB, e você vai querer ao menos 32 GB de RAM para rodá-lo com folga. Ele não cabe numa placa de 12 GB como a RTX 3060, então, na prática, você precisa de uma GPU de 24 GB, um Mac Apple Silicon com bastante memória ou uma workstation com RAM de sobra. Se você tem esse hardware, é um dos melhores modelos de raciocínio de pesos abertos que dá para hospedar por conta própria.
No dia a dia, ele pensa em voz alta antes de responder, o que é o propósito mas também o custo: cada resposta gasta tokens raciocinando, então a velocidade bruta importa. Numa RTX 4090 dá para esperar cerca de 43 tokens por segundo em 4 bits, rápido o bastante para o fluxo de raciocínio visível continuar legível; num Apple M Max cai para uns 18 tok/s, e numa CPU com DDR5 ele se arrasta a cerca de 3 tok/s, viável para tarefas em lote mas não interativo. O contexto de 128K é generoso, mas preenchê-lo sai caro aqui: na janela cheia a memória total sobe para cerca de 51.6 GB, então planeje uma máquina parruda ou mantenha o contexto modesto.
Frente ao Qwen 3 32B, que tem o mesmo tamanho e também lida com raciocínio, o DeepSeek R1 32B tende a apostar mais forte na deliberação explícita passo a passo, enquanto o Qwen 3 32B costuma parecer mais equilibrado para trabalho misto de chat com raciocínio. O traço marcante do R1 32B é justamente esse rastro de raciocínio visível: para matemática, lógica e problemas de múltiplos passos em que você quer ver e conferir o que o modelo fez, é difícil de superar nesse tamanho. Ele vem sob a licença MIT, então você pode usá-lo comercialmente e em produção, sem os termos específicos de provedor que acompanham algumas famílias de pesos abertos.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 19.9 GB | 32 GB | Recomendada |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Alta |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Quase original |
| F16 | 16 | 65.6 GB | 96 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~20.9 GB |
| 8K tokens | ~2.0 GB | ~21.9 GB |
| 32K tokens | ~7.9 GB | ~27.8 GB |
| 128K tokens | ~31.7 GB | ~51.6 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run deepseek-r1:32bFontes e downloads
Ollama Library
Baixe e rode o modelo com um único comando.
ollama.comHugging Face
Pesos do modelo, arquivos e detalhes da licença.
huggingface.coRepositório oficial no GitHub
Código-fonte, releases e issues de DeepSeek.
github.comDeepSeek — página oficial
Página oficial e documentação da DeepSeek.
deepseek.com