¿Puedo ejecutar Mistral 7B?
Mistral 7B, de Mistral AI, necesita alrededor de 8 GB de RAM con la cuantización recomendada de 4 bits (descarga de 4.4 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~70 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
Mistral 7B fue el modelo que demostró por primera vez que un LLM pequeño de pesos abiertos podía ser realmente útil, y sigue siendo una opción sensata para quien quiera un asistente de chat local ligero. Con cuantización de 4 bits ocupa unos 4.4 GB, así que entra con margen de sobra en una GPU de 8 GB, corre sin problemas dentro de la memoria unificada de cualquier Mac con Apple Silicon, e incluso una versión de 2 bits de unos 3 GB es viable si lo estás ajustando a hardware más antiguo. Su licencia Apache 2.0 es de las más permisivas que existen: libre para uso comercial, sin condiciones por parte del proveedor.
En el día a día es rápido y constante para chat y resúmenes cortos. En una RTX 4090 alcanza unos 196 tokens por segundo a 4 bits, y hasta una modesta RTX 3060 12GB se mantiene en torno a 70 tok/s, más rápido de lo que puedes leer; un Mac con chip M-series Max ronda los 80 tok/s. La ventana de contexto de 32K es cómoda pero no enorme, y llenarla por completo eleva la memoria total a unos 8.4 GB, así que en una tarjeta ajustada de 8 GB conviene mantener el contexto de trabajo moderado en lugar de saturar toda la ventana.
La pega honesta es la edad: lanzado a finales de 2023, queda por detrás de modelos pequeños más nuevos en razonamiento complejo y seguimiento de instrucciones, y Mistral Nemo 12B suele manejar mejor los prompts más largos y exigentes si puedes permitirte la memoria. Para programar en concreto, Qwen 2.5 Coder 7B tiende a ser la opción más fuerte a un tamaño similar. Donde Mistral 7B aún gana es en simplicidad y alcance: es diminuto, totalmente abierto bajo Apache 2.0, y cuenta con años de herramientas detrás de la sencilla etiqueta 'mistral' de Ollama, lo que lo convierte en una base fiable y sin sorpresas.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.0 GB | 6 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 4.4 GB | 8 GB | Recomendada |
| Q5_K_M | 5.65 | 5.1 GB | 8 GB | Alta |
| Q8_0 | 8.5 | 7.7 GB | 12 GB | Casi original |
| F16 | 16 | 14.4 GB | 24 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.5 GB | ~4.9 GB |
| 8K tokens | ~1.0 GB | ~5.4 GB |
| 32K tokens | ~4.0 GB | ~8.4 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~70 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~196 tok/s |
| Apple M-series (base) | 100 GB/s | ~19 tok/s |
| Apple M-series Pro | 270 GB/s | ~53 tok/s |
| Apple M-series Max | 410 GB/s | ~80 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~12 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run mistralFuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Mistral AI.
github.comMistral AI — página oficial
Página oficial y documentación de Mistral AI.
mistral.ai