← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o DeepSeek R1 1.5B?

O DeepSeek R1 1.5B, da DeepSeek, precisa de cerca de 3 GB de RAM na quantização recomendada de 4 bits (download de 1.1 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~280 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O DeepSeek R1 1.5B é um modelo de raciocínio destilado, e essa palavra importa: ele foi ajustado para pensar em voz alta ao longo de um problema, em vez de bater papo de forma leve. Com 1.8B de parâmetros, é minúsculo. Um quant de 4-bit fica em torno de 1.1 GB, e até a versão de 8-bit tem só 1.9 GB, então cabe bem abaixo dos 3 GB de RAM mínima. Isso significa que ele roda em qualquer lugar: um notebook antigo, uma placa do tipo Raspberry Pi, um celular ou como auxiliar em segundo plano que mal toca na sua GPU. Baixe com ollama run deepseek-r1:1.5b e você está rodando em segundos.

No uso diário ele é realmente rápido. Numa RTX 3060 dá para esperar cerca de 280 tokens por segundo, uma 4090 chega perto de 785, e um Apple M-series Max fica em torno de 319, então a resposta visível depende mais de quanto tempo ele raciocina do que da velocidade bruta. Mesmo em CPU pura com DDR5 ele alcança uns 47 tokens por segundo. O contexto de 128K é a pegadinha: este modelo gasta tokens na própria cadeia de raciocínio, e encher essa janela leva a memória total a cerca de 9.7 GB, bem acima do consumo ocioso. Mantenha o contexto de trabalho enxuto e deixe-o pensar em rajadas curtas.

Sendo honesto, neste tamanho o raciocínio é instável em qualquer coisa com várias etapas; seus irmãos maiores DeepSeek R1 7B e R1 8B são bem mais confiáveis quando a resposta de fato importa, e o Qwen 3 1.7B é a melhor escolha se você quer principalmente conversa direta em vez de raciocínio visível. Onde o 1.5B vence é no alcance: é a forma mais enxuta de ver traços de raciocínio no estilo R1 rodando localmente, e ele faz isso em hardware onde nada mais roda. A licença MIT é o bônus, totalmente aberta e livre para uso comercial, sem amarras.

Especificações

Parâmetros1.8B
Janela de contexto128K tokens
FornecedorDeepSeek
LicençaMIT
Lançamento2025-01
Ideal paraRaciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.350.8 GB3 GBPerda perceptível
Q4_K_MRecomendada4.851.1 GB3 GBRecomendada
Q5_K_M5.651.3 GB4 GBAlta
Q8_08.51.9 GB4 GBQuase original
F16163.6 GB6 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.3 GB~1.4 GB
8K tokens~0.5 GB~1.6 GB
32K tokens~2.1 GB~3.2 GB
128K tokens~8.6 GB~9.7 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~280 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~785 tok/s
Apple M-series (base)100 GB/s~78 tok/s
Apple M-series Pro270 GB/s~210 tok/s
Apple M-series Max410 GB/s~319 tok/s
CPU only (dual-channel DDR5)60 GB/s~47 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run deepseek-r1:1.5b

Perguntas frequentes

Requisitos de sistema do DeepSeek R1 1.5B — Posso rodar localmente?