← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Gemma 3n E4B?

Gemma 3n E4B, de Google, necesita alrededor de 8 GB de RAM con la cuantización recomendada de 4 bits (descarga de 4.7 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~126 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Gemma 3n E4B es el modelo multimodal pequeño de Google, pensado para chat y visión, y apunta de lleno a quien busca un asistente local competente que además entienda imágenes. Sobre el papel tiene 7.8B de parámetros, pero usa un diseño mixture-of-experts: solo unos 4B se activan por token, así que corre bastante más rápido de lo que su tamaño completo sugiere. En 4 bits ronda los 4.7 GB, lo que entra de sobra en una GPU de 8 GB como una RTX 3060 y cabe con holgura en la memoria unificada de cualquier Mac con Apple Silicon reciente. La pega del MoE es que igual debes cargar el modelo entero en memoria, así que cuenta con al menos 8 GB de RAM sin importar cuántos expertos se disparen.

En el día a día se siente ágil. En una RTX 3060 12GB puedes esperar unos 126 tokens por segundo en 4 bits, y una 4090 lo lleva a unos 353, ambas muy por encima de la velocidad de lectura; un M-series Max queda cerca de 144, e incluso CPU puro sobre DDR5 logra unos 21, usable si no tienes prisa. La visión es el verdadero motivo para elegirlo frente a un modelo solo de texto de este tamaño. El contexto llega como máximo a 32K, cómodo para chat y preguntas sobre documentos, pero no es un caballo de batalla de contexto largo. Si llenas esa ventana, la memoria total sube a unos 8.8 GB, así que en una tarjeta de 8 GB conviene mantener el contexto de trabajo moderado.

Frente a Llama 3.1 8B, la alternativa evidente solo de texto en su categoría, Gemma 3n E4B suele ceder algo de profundidad de razonamiento puro a cambio de dos cosas que Llama no ofrece con esta huella: comprensión nativa de imágenes y la ventaja de velocidad del MoE. Si solo necesitas texto, Gemma 3 4B es el hermano más ligero y Llama 3.1 8B la apuesta más segura para chat puro. Lo que destaca de Gemma 3n E4B es ser un modelo de visión y chat realmente usable que aun así entra en 8 GB. Una nota sobre licencias: la licencia Gemma es de pesos abiertos, no de código abierto, con los términos de uso propios de Google, así que léelos antes de publicar; eso sí, el uso comercial está permitido.

Especificaciones

Parámetros7.8B (4B activos)
Ventana de contexto32K tokens
ProveedorGoogle
LicenciaGemma
Lanzamiento2025-06
Ideal paraChat, Visión

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.353.3 GB6 GBPérdida notable
Q4_K_MRecomendada4.854.7 GB8 GBRecomendada
Q5_K_M5.655.5 GB12 GBAlta
Q8_08.58.3 GB12 GBCasi original
F161615.6 GB24 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.5 GB~5.2 GB
8K tokens~1.0 GB~5.7 GB
32K tokens~4.1 GB~8.8 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~126 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~353 tok/s
Apple M-series (base)100 GB/s~35 tok/s
Apple M-series Pro270 GB/s~95 tok/s
Apple M-series Max410 GB/s~144 tok/s
CPU only (dual-channel DDR5)60 GB/s~21 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run gemma3n

Preguntas frecuentes

Requisitos de sistema de Gemma 3n E4B — ¿Puedo ejecutarlo en local?