← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar DeepSeek R1 1.5B?

DeepSeek R1 1.5B, de DeepSeek, necesita alrededor de 3 GB de RAM con la cuantización recomendada de 4 bits (descarga de 1.1 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~280 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

DeepSeek R1 1.5B es un modelo de razonamiento destilado, y esa palabra importa: está ajustado para pensar en voz alta a lo largo de un problema en lugar de charlar a la ligera. Con 1.8B de parámetros es diminuto. Una cuantización de 4 bits ronda los 1.1 GB, e incluso la versión de 8 bits ocupa solo 1.9 GB, así que cabe de sobra por debajo de los 3 GB de RAM mínima. Eso significa que corre en cualquier parte: un portátil viejo, una placa tipo Raspberry Pi, un teléfono, o como asistente en segundo plano que apenas toca tu GPU. Descárgalo con ollama run deepseek-r1:1.5b y lo tienes funcionando en segundos.

En el día a día es realmente ágil. En una RTX 3060 puedes esperar unos 280 tokens por segundo, una 4090 se acerca a 785, y un Apple M-series Max se sitúa en torno a 319, así que la respuesta visible depende más de cuánto razona que de la velocidad bruta. Incluso en CPU pura sobre DDR5 logra alrededor de 47 tokens por segundo. El contexto de 128K es la trampa: este modelo gasta tokens en su propia cadena de pensamiento, y llenar esa ventana empuja la memoria total hasta unos 9.7 GB, muy por encima del consumo en reposo. Mantén el contexto de trabajo moderado y déjalo pensar en ráfagas cortas.

Siendo honestos, a este tamaño el razonamiento es irregular en cualquier cosa con varios pasos; sus hermanos mayores DeepSeek R1 7B y R1 8B son mucho más fiables cuando la respuesta de verdad importa, y Qwen 3 1.7B es la mejor opción si lo que quieres es chat sencillo en lugar de razonamiento visible. Donde gana el 1.5B es en alcance: es la forma más pequeña de ver trazas de pensamiento al estilo R1 corriendo en local, y lo hace en hardware donde nada más lo conseguiría. La licencia MIT es el extra: totalmente abierta y de uso comercial gratuito, sin ataduras.

Especificaciones

Parámetros1.8B
Ventana de contexto128K tokens
ProveedorDeepSeek
LicenciaMIT
Lanzamiento2025-01
Ideal paraRazonamiento

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.350.8 GB3 GBPérdida notable
Q4_K_MRecomendada4.851.1 GB3 GBRecomendada
Q5_K_M5.651.3 GB4 GBAlta
Q8_08.51.9 GB4 GBCasi original
F16163.6 GB6 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.3 GB~1.4 GB
8K tokens~0.5 GB~1.6 GB
32K tokens~2.1 GB~3.2 GB
128K tokens~8.6 GB~9.7 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~280 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~785 tok/s
Apple M-series (base)100 GB/s~78 tok/s
Apple M-series Pro270 GB/s~210 tok/s
Apple M-series Max410 GB/s~319 tok/s
CPU only (dual-channel DDR5)60 GB/s~47 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run deepseek-r1:1.5b

Preguntas frecuentes