← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Gemma 3 1B?

Gemma 3 1B, de Google, necesita alrededor de 3 GB de RAM con la cuantización recomendada de 4 bits (descarga de 0.6 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~505 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Gemma 3 1B es un modelo de chat diminuto de Google, pensado para esos casos en los que quieres un asistente local que cargue al instante y funcione casi en cualquier parte. En cuantización de 4 bits ocupa apenas unos 0,6 GB, y hasta una versión de 8 bits ronda los 1,1 GB, así que cabe en 3 GB de RAM y de sobra. Eso significa que corre en un portátil viejo, en un dispositivo tipo Raspberry Pi o en un chip de nivel móvil sin tocar una GPU dedicada. Si necesitas algo para chat rápido, redacción o para incrustarlo en una app donde cada megabyte cuenta, este es el modelo al que recurrir.

En el día a día lo que destaca es la velocidad pura. En una RTX 4090 llega a unos 1413 tokens por segundo, y una RTX 3060 más habitual aún hace unos 505 tok/s, con una Apple M Max en torno a 575 tok/s. Incluso en CPU pura sobre DDR5 alcanza unos 84 tok/s, más rápido de lo que puedes leer. La ventana de contexto es de 32K y, a diferencia de los modelos más grandes, puedes llenar buena parte de ella sin coste: a los 32K completos el conjunto se queda en unos 2,2 GB en total, así que aquí la memoria nunca es lo que te frena.

Conviene ser honesto sobre su tamaño: con 1B de parámetros no es un modelo de razonamiento ni de programación, y se perderá en instrucciones largas de varios pasos. Si tienes margen, Gemma 3 4B suele manejar prompts más difíciles y añade visión, mientras que Llama 3.2 1B es la alternativa obvia del mismo peso para comparar en chat sencillo. La cualidad que distingue a Gemma 3 1B es que es más o menos el modelo de chat realmente usable más pequeño que puedes ejecutar. Una advertencia: se distribuye bajo la licencia Gemma de Google, que es de pesos abiertos pero incluye términos propios del proveedor, así que léelos antes de usarlo comercialmente.

Especificaciones

Parámetros1B
Ventana de contexto32K tokens
ProveedorGoogle
LicenciaGemma
Lanzamiento2025-03
Ideal paraChat

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.350.4 GB2 GBPérdida notable
Q4_K_MRecomendada4.850.6 GB3 GBRecomendada
Q5_K_M5.650.7 GB3 GBAlta
Q8_08.51.1 GB3 GBCasi original
F16162.0 GB4 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.2 GB~0.8 GB
8K tokens~0.4 GB~1.0 GB
32K tokens~1.6 GB~2.2 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~505 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~1413 tok/s
Apple M-series (base)100 GB/s~140 tok/s
Apple M-series Pro270 GB/s~379 tok/s
Apple M-series Max410 GB/s~575 tok/s
CPU only (dual-channel DDR5)60 GB/s~84 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run gemma3:1b

Preguntas frecuentes