← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Mistral 7B?

Mistral 7B, de Mistral AI, necesita alrededor de 8 GB de RAM con la cuantización recomendada de 4 bits (descarga de 4.4 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~70 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Mistral 7B fue el modelo que demostró por primera vez que un LLM pequeño de pesos abiertos podía ser realmente útil, y sigue siendo una opción sensata para quien quiera un asistente de chat local ligero. Con cuantización de 4 bits ocupa unos 4.4 GB, así que entra con margen de sobra en una GPU de 8 GB, corre sin problemas dentro de la memoria unificada de cualquier Mac con Apple Silicon, e incluso una versión de 2 bits de unos 3 GB es viable si lo estás ajustando a hardware más antiguo. Su licencia Apache 2.0 es de las más permisivas que existen: libre para uso comercial, sin condiciones por parte del proveedor.

En el día a día es rápido y constante para chat y resúmenes cortos. En una RTX 4090 alcanza unos 196 tokens por segundo a 4 bits, y hasta una modesta RTX 3060 12GB se mantiene en torno a 70 tok/s, más rápido de lo que puedes leer; un Mac con chip M-series Max ronda los 80 tok/s. La ventana de contexto de 32K es cómoda pero no enorme, y llenarla por completo eleva la memoria total a unos 8.4 GB, así que en una tarjeta ajustada de 8 GB conviene mantener el contexto de trabajo moderado en lugar de saturar toda la ventana.

La pega honesta es la edad: lanzado a finales de 2023, queda por detrás de modelos pequeños más nuevos en razonamiento complejo y seguimiento de instrucciones, y Mistral Nemo 12B suele manejar mejor los prompts más largos y exigentes si puedes permitirte la memoria. Para programar en concreto, Qwen 2.5 Coder 7B tiende a ser la opción más fuerte a un tamaño similar. Donde Mistral 7B aún gana es en simplicidad y alcance: es diminuto, totalmente abierto bajo Apache 2.0, y cuenta con años de herramientas detrás de la sencilla etiqueta 'mistral' de Ollama, lo que lo convierte en una base fiable y sin sorpresas.

Especificaciones

Parámetros7.2B
Ventana de contexto32K tokens
ProveedorMistral AI
LicenciaApache 2.0
Lanzamiento2023-09
Ideal paraChat

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.353.0 GB6 GBPérdida notable
Q4_K_MRecomendada4.854.4 GB8 GBRecomendada
Q5_K_M5.655.1 GB8 GBAlta
Q8_08.57.7 GB12 GBCasi original
F161614.4 GB24 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.5 GB~4.9 GB
8K tokens~1.0 GB~5.4 GB
32K tokens~4.0 GB~8.4 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~70 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~196 tok/s
Apple M-series (base)100 GB/s~19 tok/s
Apple M-series Pro270 GB/s~53 tok/s
Apple M-series Max410 GB/s~80 tok/s
CPU only (dual-channel DDR5)60 GB/s~12 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run mistral

Preguntas frecuentes