¿Puedo ejecutar Qwen 3 30B-A3B?
Qwen 3 30B-A3B, de Alibaba, necesita alrededor de 32 GB de RAM con la cuantización recomendada de 4 bits (descarga de 18.5 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~174 tok/s en un Apple M-series Max.
Leyendo las señales de tu hardware…
Notas del mundo real
Qwen 3 30B-A3B es un modelo de mezcla de expertos (MoE), y ese único detalle define todo lo que debes saber sobre él. Tiene 30.5B de parámetros sobre el papel, pero solo 3.3B se activan por token, así que corre a la velocidad de un modelo diminuto mientras razona con la amplitud de uno grande. El problema es la memoria: aun así tienes que mantenerlo entero en RAM. Una cuantización de 4 bits ocupa unos 18.5 GB y el modelo necesita al menos 32 GB para respirar, lo que descarta una tarjeta de 12 GB como la RTX 3060, pero entra cómodo en un Mac con Apple Silicon de 32 GB, o en una 4090 de 24 GB si mantienes el contexto contenido.
En el uso diario el diseño MoE rinde de una forma que la ficha técnica no llega a transmitir. En una 4090 puedes ver alrededor de 428 tokens por segundo, e incluso un chip M-series Max se mantiene ágil con unos 174 tok/s, muchísimo más rápido de lo que jamás lograría un modelo denso de 30B en el mismo hardware. Solo con CPU sobre DDR5 baja a unos 25 tok/s, útil para trabajos por lotes pero no para chat interactivo. El contexto de 128K es real, pero cuida el presupuesto: llenarlo eleva la memoria total a unos 49.1 GB, así que en una máquina de 32 GB conviene mantener el contexto de trabajo acotado y apoyarse en una cuantización más pequeña en vez de perseguir la ventana completa.
Frente a Gemma 4 31B, que ronda los casi idénticos 30.7B de parámetros, el equilibrio queda claro. Gemma es densa y suma capacidades de programación y visión, así que tiende a sentirse más fuerte en tareas multimodales y de código estructurado, mientras que el diseño disperso de Qwen 3 30B-A3B lo hace muchísimo más rápido por token para chat y razonamiento en esta categoría de tamaño. Esa velocidad para su huella de memoria es su rasgo distintivo. Además se distribuye bajo Apache 2.0, así que, a diferencia de las licencias de pesos abiertos atadas a un proveedor concreto, puedes usarlo con libertad en trabajo comercial y de producción sin asteriscos en la licencia.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 12.8 GB | 24 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 18.5 GB | 32 GB | Recomendada |
| Q5_K_M | 5.65 | 21.5 GB | 32 GB | Alta |
| Q8_0 | 8.5 | 32.4 GB | 48 GB | Casi original |
| F16 | 16 | 61.0 GB | 96 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~19.5 GB |
| 8K tokens | ~1.9 GB | ~20.4 GB |
| 32K tokens | ~7.7 GB | ~26.2 GB |
| 128K tokens | ~30.6 GB | ~49.1 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | No cabe en la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~428 tok/s |
| Apple M-series (base) | 100 GB/s | ~42 tok/s |
| Apple M-series Pro | 270 GB/s | ~115 tok/s |
| Apple M-series Max | 410 GB/s | ~174 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~25 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run qwen3:30bFuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Alibaba.
github.comAlibaba — página oficial
Página oficial y documentación de Alibaba.
qwen.ai