¿Puedo ejecutar Qwen 3 4B?
Qwen 3 4B, de Alibaba, necesita alrededor de 6 GB de RAM con la cuantización recomendada de 4 bits (descarga de 2.4 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~126 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
Qwen 3 4B es el modelo al que recurrir cuando quieres razonamiento de verdad en algo pequeño. En un cuantizado de 4 bits ronda los 2.4 GB, así que cabe en casi cualquier cosa: una GPU de 6 GB tiene margen de sobra, cualquier Mac con Apple Silicon lo asimila sin esfuerzo e incluso un portátil más antiguo con gráfica integrada puede alojarlo. Lo mínimo recomendable para un uso cómodo son unos 6 GB de RAM. Si trabajas en una máquina solo con CPU o en un dispositivo tipo Raspberry, este es uno de los pocos modelos que sigue siendo realmente útil con esta huella, no solo cargable sobre el papel.
En el día a día se siente ágil. En una RTX 3060 alcanza unos 126 tokens por segundo a 4 bits, y un Max de la serie M se queda cerca de los 144, ambos muy por encima de la velocidad de lectura, así que las respuestas fluyen al instante para chat y cadenas de razonamiento cortas. Una 4090 llega a unos 353 si dispones de ella. La CPU pura sobre DDR5 baja a unos 21 tokens por segundo, lento pero válido para tareas en segundo plano. La ventana de contexto es de 32K, de sobra para casi todo, pero llenarla eleva la memoria total a unos 5.5 GB, así que en una máquina ajustada de 6 GB conviene mantener el contexto de trabajo moderado.
Dentro de su propia familia, Qwen 3 4B es el salto evidente desde Qwen 3 1.7B cuando el modelo más pequeño empieza a trastabillar con prompts de varios pasos, sin dejar de ser mucho más ligero que el rango de 7-8B. Phi-4 Mini 3.8B es una alternativa razonable de tamaño similar y en general compite de tú a tú en chat, pero el rasgo que distingue a Qwen 3 4B es rendir por encima de su recuento de parámetros en tareas de razonamiento por lo poco que cuesta ejecutarlo. Se distribuye bajo Apache 2.0, así que puedes usarlo de forma comercial y en producción sin preocuparte por la licencia, algo raro con esta relación calidad-tamaño.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.7 GB | 4 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 2.4 GB | 6 GB | Recomendada |
| Q5_K_M | 5.65 | 2.8 GB | 6 GB | Alta |
| Q8_0 | 8.5 | 4.3 GB | 8 GB | Casi original |
| F16 | 16 | 8.0 GB | 12 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.4 GB | ~2.8 GB |
| 8K tokens | ~0.8 GB | ~3.2 GB |
| 32K tokens | ~3.1 GB | ~5.5 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run qwen3:4bFuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Alibaba.
github.comAlibaba — página oficial
Página oficial y documentación de Alibaba.
qwen.ai