← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Gemma 3 12B?

Gemma 3 12B, de Google, necesita alrededor de 12 GB de RAM con la cuantización recomendada de 4 bits (descarga de 7.4 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~41 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Gemma 3 12B es el modelo de pesos abiertos de tamaño medio de Google, y ocupa un punto útil para quienes quieren más capacidad que los típicos modelos de chat de 7-8B sin saltar a algo que exija una workstation. En cuantización de 4 bits ronda los 7.4 GB, lo que cabe en una tarjeta de 12 GB como una RTX 3060 con un poco de margen, y corre sin problemas en la memoria unificada de un Mac con Apple Silicon de 16 GB o más. El mínimo para cargarlo es de 12 GB de RAM. Además maneja visión, así que puedes pasarle imágenes junto al texto, algo que la mayoría de modelos de este tamaño no puede.

En el uso diario se siente ágil en hardware de consumo. En una RTX 3060 12GB obtienes alrededor de 41 tokens por segundo en 4 bits, más rápido de lo que lees, y un Apple M Max lo lleva a aproximadamente 47 tok/s. Una 4090 vuela a unos 116 tok/s si tienes una. La ventana de contexto de 128K es el truco: existe de verdad, pero llenarla sale caro. Al máximo de 128K, el modelo más la caché KV necesita unos 27.7 GB en total, muy por encima de lo que aguanta una tarjeta de 12 GB, así que mantén un contexto de trabajo moderado salvo que tengas una GPU de 24 GB o bastante memoria unificada.

Frente a Mistral Nemo 12B, la alternativa obvia del mismo tamaño, Gemma 3 12B suele llevar ventaja en seguimiento de instrucciones y trabajo multimodal, ya que Nemo es solo de texto, aunque Nemo tiende a ser la opción más ligera para chat de contexto largo puro. Si quieres quedarte en algo más pequeño, Gemma 3 4B reduce la huella conservando la visión. Lo que distingue a Gemma 3 12B es ser un modelo competente de visión y chat que aún corre en una sola GPU de gama media. Una advertencia: se distribuye bajo la licencia Gemma de Google, que es de pesos abiertos pero incluye términos específicos del proveedor, así que léelos antes de cualquier despliegue comercial en lugar de dar por hecho que es código abierto sin más.

Especificaciones

Parámetros12.2B
Ventana de contexto128K tokens
ProveedorGoogle
LicenciaGemma
Lanzamiento2025-03
Ideal paraChat, Visión

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.355.1 GB8 GBPérdida notable
Q4_K_MRecomendada4.857.4 GB12 GBRecomendada
Q5_K_M5.658.6 GB16 GBAlta
Q8_08.513.0 GB24 GBCasi original
F161624.4 GB32 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.6 GB~8.0 GB
8K tokens~1.3 GB~8.7 GB
32K tokens~5.1 GB~12.5 GB
128K tokens~20.3 GB~27.7 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~41 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~116 tok/s
Apple M-series (base)100 GB/s~11 tok/s
Apple M-series Pro270 GB/s~31 tok/s
Apple M-series Max410 GB/s~47 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run gemma3:12b

Preguntas frecuentes

Requisitos de sistema de Gemma 3 12B — ¿Puedo ejecutarlo en local?