¿Puedo ejecutar Phi-4 Mini 3.8B?
Phi-4 Mini 3.8B, de Microsoft, necesita alrededor de 6 GB de RAM con la cuantización recomendada de 4 bits (descarga de 2.3 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~133 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
Phi-4 Mini 3.8B es el modelo de chat pequeño de Microsoft, el que conviene elegir cuando quieres algo realmente ligero que aun así mantenga una conversación. En cuantización de 4 bits ronda los 2.3 GB y baja a unos 1.6 GB en 2 bits, así que cabe casi en cualquier parte: en una GPU de 6 GB sobra espacio, un Mac M1 de entrada lo corre sin esfuerzo y hasta un portátil viejo lo maneja en CPU. La licencia MIT es la parte fácil: no hay términos que leer ni restricciones comerciales, así que puedes integrarlo en un producto con total libertad.
En el día a día es rápido. En una RTX 3060 verás unos 133 tok/s, un M-series Max se sitúa cerca de 151 tok/s y una 4090 lo empuja por encima de 370 tok/s, mucho más rápido de lo que alcanzas a leer. El contexto de 128K es la cifra que llama la atención, pero tómala con cautela: si lo llenas, la memoria total sube hasta unos 14.3 GB, muy por encima de los 6 GB que este modelo necesita en reposo. En una GPU pequeña, mantén el contexto de trabajo en unos pocos miles de tokens y irás cómodo. Incluso en CPU con DDR5 logra alrededor de 22 tok/s en prompts cortos.
Donde se nota su tamaño es en la profundidad. Para razonamiento e instrucciones de varios pasos, Qwen 3 4B suele llevar ventaja pese a tener más o menos el mismo número de parámetros, y si necesitas margen real de razonamiento, Phi-4 14B es el salto evidente. La virtud que distingue a Phi-4 Mini es la eficiencia: rinde por encima de sus 3.8B en chat sencillo y resúmenes, manteniéndose lo bastante pequeño para correr casi en cualquier sitio, con licencia MIT y sin restricciones. Si buscas un asistente local diminuto que cargue rápido y no te estorbe, es una opción por defecto sólida.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.6 GB | 4 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 2.3 GB | 6 GB | Recomendada |
| Q5_K_M | 5.65 | 2.7 GB | 6 GB | Alta |
| Q8_0 | 8.5 | 4.0 GB | 8 GB | Casi original |
| F16 | 16 | 7.6 GB | 12 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.4 GB | ~2.7 GB |
| 8K tokens | ~0.8 GB | ~3.1 GB |
| 32K tokens | ~3.0 GB | ~5.3 GB |
| 128K tokens | ~12.0 GB | ~14.3 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~133 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~372 tok/s |
| Apple M-series (base) | 100 GB/s | ~37 tok/s |
| Apple M-series Pro | 270 GB/s | ~100 tok/s |
| Apple M-series Max | 410 GB/s | ~151 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~22 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run phi4-miniFuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Microsoft.
github.comMicrosoft — página oficial
Página oficial y documentación de Microsoft.
azure.microsoft.com