Posso rodar o DeepSeek R1 14B?
O DeepSeek R1 14B, da DeepSeek, precisa de cerca de 16 GB de RAM na quantização recomendada de 4 bits (download de 9.0 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~34 tok/s em um NVIDIA RTX 3060 12GB.
Lendo os sinais do seu hardware…
Notas do mundo real
O DeepSeek R1 14B é um modelo de raciocínio, não um companheiro de bate-papo rápido. Com 14.8B de parâmetros, ele fica num meio-termo desconfortável: um quant de 4 bits gira em torno de 9 GB, o que já estoura uma placa de 12 GB assim que você adiciona contexto, e o mínimo recomendado é de 16 GB de RAM. Roda tranquilo numa GPU de 24 GB como uma RTX 4090 ou num Mac com Apple Silicon de mais memória, mas numa RTX 3060 de 12 GB você fica bem no limite. A licença MIT é a parte fácil: uso livre, inclusive comercial, sem amarras do provedor.
No dia a dia ele pensa em voz alta antes de responder, então espere longas cadeias de tokens de raciocínio em cada prompt. Numa RTX 4090 você tem cerca de 95 tok/s, rápido o bastante para o raciocínio passar fluido; numa RTX 3060 cai para uns 34 tok/s e num Mac M-Max para uns 39 tok/s, ponto em que esses rastros longos começam a parecer lentos. O contexto de 128K é real, mas caro: preenchê-lo eleva a memória total para cerca de 31.1 GB, muito além de qualquer configuração de 16 GB, então mantenha o contexto de trabalho modesto, a menos que você tenha uma máquina de 32 GB ou mais.
Frente ao Qwen 3 14B, que tem a mesma contagem de 14.8B de parâmetros mas também dá conta de bate-papo comum, o R1 14B é a escolha mais especializada: ele costuma compensar em matemática e lógica de múltiplas etapas, mas soa pesado demais para uma troca simples, em que o Qwen tende a ser mais rápido e direto. Seu grande diferencial é o raciocínio transparente num tamanho que você realmente consegue hospedar por conta própria. Se quiser a mesma abordagem mais leve, o DeepSeek R1 7B cai para mais ou menos a metade dos parâmetros e se encaixa com mais folga numa placa de 12 GB.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.2 GB | 12 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 9.0 GB | 16 GB | Recomendada |
| Q5_K_M | 5.65 | 10.5 GB | 16 GB | Alta |
| Q8_0 | 8.5 | 15.7 GB | 24 GB | Quase original |
| F16 | 16 | 29.6 GB | 48 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.7 GB | ~9.7 GB |
| 8K tokens | ~1.4 GB | ~10.4 GB |
| 32K tokens | ~5.5 GB | ~14.5 GB |
| 128K tokens | ~22.1 GB | ~31.1 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~95 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~26 tok/s |
| Apple M-series Max | 410 GB/s | ~39 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run deepseek-r1:14bFontes e downloads
Ollama Library
Baixe e rode o modelo com um único comando.
ollama.comHugging Face
Pesos do modelo, arquivos e detalhes da licença.
huggingface.coRepositório oficial no GitHub
Código-fonte, releases e issues de DeepSeek.
github.comDeepSeek — página oficial
Página oficial e documentação da DeepSeek.
deepseek.com