← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o DeepSeek R1 14B?

O DeepSeek R1 14B, da DeepSeek, precisa de cerca de 16 GB de RAM na quantização recomendada de 4 bits (download de 9.0 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~34 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O DeepSeek R1 14B é um modelo de raciocínio, não um companheiro de bate-papo rápido. Com 14.8B de parâmetros, ele fica num meio-termo desconfortável: um quant de 4 bits gira em torno de 9 GB, o que já estoura uma placa de 12 GB assim que você adiciona contexto, e o mínimo recomendado é de 16 GB de RAM. Roda tranquilo numa GPU de 24 GB como uma RTX 4090 ou num Mac com Apple Silicon de mais memória, mas numa RTX 3060 de 12 GB você fica bem no limite. A licença MIT é a parte fácil: uso livre, inclusive comercial, sem amarras do provedor.

No dia a dia ele pensa em voz alta antes de responder, então espere longas cadeias de tokens de raciocínio em cada prompt. Numa RTX 4090 você tem cerca de 95 tok/s, rápido o bastante para o raciocínio passar fluido; numa RTX 3060 cai para uns 34 tok/s e num Mac M-Max para uns 39 tok/s, ponto em que esses rastros longos começam a parecer lentos. O contexto de 128K é real, mas caro: preenchê-lo eleva a memória total para cerca de 31.1 GB, muito além de qualquer configuração de 16 GB, então mantenha o contexto de trabalho modesto, a menos que você tenha uma máquina de 32 GB ou mais.

Frente ao Qwen 3 14B, que tem a mesma contagem de 14.8B de parâmetros mas também dá conta de bate-papo comum, o R1 14B é a escolha mais especializada: ele costuma compensar em matemática e lógica de múltiplas etapas, mas soa pesado demais para uma troca simples, em que o Qwen tende a ser mais rápido e direto. Seu grande diferencial é o raciocínio transparente num tamanho que você realmente consegue hospedar por conta própria. Se quiser a mesma abordagem mais leve, o DeepSeek R1 7B cai para mais ou menos a metade dos parâmetros e se encaixa com mais folga numa placa de 12 GB.

Especificações

Parâmetros14.8B
Janela de contexto128K tokens
FornecedorDeepSeek
LicençaMIT
Lançamento2025-01
Ideal paraRaciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.356.2 GB12 GBPerda perceptível
Q4_K_MRecomendada4.859.0 GB16 GBRecomendada
Q5_K_M5.6510.5 GB16 GBAlta
Q8_08.515.7 GB24 GBQuase original
F161629.6 GB48 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.7 GB~9.7 GB
8K tokens~1.4 GB~10.4 GB
32K tokens~5.5 GB~14.5 GB
128K tokens~22.1 GB~31.1 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~95 tok/s
Apple M-series (base)100 GB/s~9 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run deepseek-r1:14b

Perguntas frequentes