¿Puedo ejecutar Gemma 3n E4B?
Gemma 3n E4B, de Google, necesita alrededor de 8 GB de RAM con la cuantización recomendada de 4 bits (descarga de 4.7 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~126 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
Gemma 3n E4B es el modelo multimodal pequeño de Google, pensado para chat y visión, y apunta de lleno a quien busca un asistente local competente que además entienda imágenes. Sobre el papel tiene 7.8B de parámetros, pero usa un diseño mixture-of-experts: solo unos 4B se activan por token, así que corre bastante más rápido de lo que su tamaño completo sugiere. En 4 bits ronda los 4.7 GB, lo que entra de sobra en una GPU de 8 GB como una RTX 3060 y cabe con holgura en la memoria unificada de cualquier Mac con Apple Silicon reciente. La pega del MoE es que igual debes cargar el modelo entero en memoria, así que cuenta con al menos 8 GB de RAM sin importar cuántos expertos se disparen.
En el día a día se siente ágil. En una RTX 3060 12GB puedes esperar unos 126 tokens por segundo en 4 bits, y una 4090 lo lleva a unos 353, ambas muy por encima de la velocidad de lectura; un M-series Max queda cerca de 144, e incluso CPU puro sobre DDR5 logra unos 21, usable si no tienes prisa. La visión es el verdadero motivo para elegirlo frente a un modelo solo de texto de este tamaño. El contexto llega como máximo a 32K, cómodo para chat y preguntas sobre documentos, pero no es un caballo de batalla de contexto largo. Si llenas esa ventana, la memoria total sube a unos 8.8 GB, así que en una tarjeta de 8 GB conviene mantener el contexto de trabajo moderado.
Frente a Llama 3.1 8B, la alternativa evidente solo de texto en su categoría, Gemma 3n E4B suele ceder algo de profundidad de razonamiento puro a cambio de dos cosas que Llama no ofrece con esta huella: comprensión nativa de imágenes y la ventaja de velocidad del MoE. Si solo necesitas texto, Gemma 3 4B es el hermano más ligero y Llama 3.1 8B la apuesta más segura para chat puro. Lo que destaca de Gemma 3n E4B es ser un modelo de visión y chat realmente usable que aun así entra en 8 GB. Una nota sobre licencias: la licencia Gemma es de pesos abiertos, no de código abierto, con los términos de uso propios de Google, así que léelos antes de publicar; eso sí, el uso comercial está permitido.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.3 GB | 6 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 4.7 GB | 8 GB | Recomendada |
| Q5_K_M | 5.65 | 5.5 GB | 12 GB | Alta |
| Q8_0 | 8.5 | 8.3 GB | 12 GB | Casi original |
| F16 | 16 | 15.6 GB | 24 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.5 GB | ~5.2 GB |
| 8K tokens | ~1.0 GB | ~5.7 GB |
| 32K tokens | ~4.1 GB | ~8.8 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run gemma3nFuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Google.
github.comGoogle — página oficial
Página oficial y documentación de Google.
ai.google.dev