¿Puedo ejecutar SmolLM2 1.7B?
SmolLM2 1.7B, de Hugging Face, necesita alrededor de 3 GB de RAM con la cuantización recomendada de 4 bits (descarga de 1.0 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~297 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
SmolLM2 1.7B es para cuando Llama 8B se queda grande: un modelo de chat verdaderamente diminuto que puedes ejecutar casi en cualquier parte. En 4 bits pesa alrededor de 1 GB, y solo necesitas unos 3 GB de RAM para cargarlo con espacio de trabajo, así que corre en una Mac M1 básica, un portátil económico, una placa tipo Raspberry Pi o cualquier teléfono moderno con algo de holgura. Tiene licencia Apache 2.0, lo que significa que puedes usarlo comercialmente y en producción sin ataduras del proveedor. Piénsalo como el modelo que integras en tus apps, no el que usas para chatear todo el día.
En el uso diario lo que más destaca es el rendimiento bruto. En una RTX 3060 alcanza unos ~297 tok/s, una M Max llega a ~338 tok/s y una 4090 ronda los ~831 tok/s, mucho más rápido de lo que puedes leer. Incluso en una CPU DDR5 normal logra unos ~49 tok/s, perfectamente usable para respuestas cortas sin GPU alguna. El verdadero límite es la ventana de contexto de 8K. Es pequeña para los estándares actuales, así que va bien para preguntas sueltas, clasificación y resúmenes cortos, pero no aguanta un documento largo. La memoria aquí no es problema: incluso llenando los 8K solo llega a unos 1.5 GB en total.
Sé honesto sobre lo que te da 1.7B. Maneja chat ligero, formateo y seguir instrucciones simples, pero se queda corto en razonamiento de varios pasos y tareas de programación más largas. Qwen 3 1.7B suele superarlo en prompts más difíciles y estructurados, y DeepSeek R1 1.5B tiende a rendir mejor cuando de verdad necesitas razonamiento encadenado (chain-of-thought) en lugar de respuestas rápidas. Frente a Llama 3.2 1B cambia un poco de peso extra por una salida más estable. Su rasgo más fuerte es la eficiencia: un asistente totalmente abierto y usable comercialmente que corre rápido en hardware que nada más con esta capacidad podría aprovechar. Recurre a él cuando el tamaño importa más que la profundidad.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 1.0 GB | 3 GB | Recomendada |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Alta |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Casi original |
| F16 | 16 | 3.4 GB | 6 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.3 GB | ~1.3 GB |
| 8K tokens | ~0.5 GB | ~1.5 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run smollm2