← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Qwen 3 30B-A3B?

Qwen 3 30B-A3B, de Alibaba, necesita alrededor de 32 GB de RAM con la cuantización recomendada de 4 bits (descarga de 18.5 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~174 tok/s en un Apple M-series Max.

Leyendo las señales de tu hardware…

Notas del mundo real

Qwen 3 30B-A3B es un modelo de mezcla de expertos (MoE), y ese único detalle define todo lo que debes saber sobre él. Tiene 30.5B de parámetros sobre el papel, pero solo 3.3B se activan por token, así que corre a la velocidad de un modelo diminuto mientras razona con la amplitud de uno grande. El problema es la memoria: aun así tienes que mantenerlo entero en RAM. Una cuantización de 4 bits ocupa unos 18.5 GB y el modelo necesita al menos 32 GB para respirar, lo que descarta una tarjeta de 12 GB como la RTX 3060, pero entra cómodo en un Mac con Apple Silicon de 32 GB, o en una 4090 de 24 GB si mantienes el contexto contenido.

En el uso diario el diseño MoE rinde de una forma que la ficha técnica no llega a transmitir. En una 4090 puedes ver alrededor de 428 tokens por segundo, e incluso un chip M-series Max se mantiene ágil con unos 174 tok/s, muchísimo más rápido de lo que jamás lograría un modelo denso de 30B en el mismo hardware. Solo con CPU sobre DDR5 baja a unos 25 tok/s, útil para trabajos por lotes pero no para chat interactivo. El contexto de 128K es real, pero cuida el presupuesto: llenarlo eleva la memoria total a unos 49.1 GB, así que en una máquina de 32 GB conviene mantener el contexto de trabajo acotado y apoyarse en una cuantización más pequeña en vez de perseguir la ventana completa.

Frente a Gemma 4 31B, que ronda los casi idénticos 30.7B de parámetros, el equilibrio queda claro. Gemma es densa y suma capacidades de programación y visión, así que tiende a sentirse más fuerte en tareas multimodales y de código estructurado, mientras que el diseño disperso de Qwen 3 30B-A3B lo hace muchísimo más rápido por token para chat y razonamiento en esta categoría de tamaño. Esa velocidad para su huella de memoria es su rasgo distintivo. Además se distribuye bajo Apache 2.0, así que, a diferencia de las licencias de pesos abiertos atadas a un proveedor concreto, puedes usarlo con libertad en trabajo comercial y de producción sin asteriscos en la licencia.

Especificaciones

Parámetros30.5B (3.3B activos)
Ventana de contexto128K tokens
ProveedorAlibaba
LicenciaApache 2.0
Lanzamiento2025-04
Ideal paraChat, Razonamiento

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.3512.8 GB24 GBPérdida notable
Q4_K_MRecomendada4.8518.5 GB32 GBRecomendada
Q5_K_M5.6521.5 GB32 GBAlta
Q8_08.532.4 GB48 GBCasi original
F161661.0 GB96 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~1.0 GB~19.5 GB
8K tokens~1.9 GB~20.4 GB
32K tokens~7.7 GB~26.2 GB
128K tokens~30.6 GB~49.1 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/sNo cabe en la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~428 tok/s
Apple M-series (base)100 GB/s~42 tok/s
Apple M-series Pro270 GB/s~115 tok/s
Apple M-series Max410 GB/s~174 tok/s
CPU only (dual-channel DDR5)60 GB/s~25 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run qwen3:30b

Preguntas frecuentes