← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Phi-4 Mini 3.8B?

Phi-4 Mini 3.8B, de Microsoft, necesita alrededor de 6 GB de RAM con la cuantización recomendada de 4 bits (descarga de 2.3 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~133 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Phi-4 Mini 3.8B es el modelo de chat pequeño de Microsoft, el que conviene elegir cuando quieres algo realmente ligero que aun así mantenga una conversación. En cuantización de 4 bits ronda los 2.3 GB y baja a unos 1.6 GB en 2 bits, así que cabe casi en cualquier parte: en una GPU de 6 GB sobra espacio, un Mac M1 de entrada lo corre sin esfuerzo y hasta un portátil viejo lo maneja en CPU. La licencia MIT es la parte fácil: no hay términos que leer ni restricciones comerciales, así que puedes integrarlo en un producto con total libertad.

En el día a día es rápido. En una RTX 3060 verás unos 133 tok/s, un M-series Max se sitúa cerca de 151 tok/s y una 4090 lo empuja por encima de 370 tok/s, mucho más rápido de lo que alcanzas a leer. El contexto de 128K es la cifra que llama la atención, pero tómala con cautela: si lo llenas, la memoria total sube hasta unos 14.3 GB, muy por encima de los 6 GB que este modelo necesita en reposo. En una GPU pequeña, mantén el contexto de trabajo en unos pocos miles de tokens y irás cómodo. Incluso en CPU con DDR5 logra alrededor de 22 tok/s en prompts cortos.

Donde se nota su tamaño es en la profundidad. Para razonamiento e instrucciones de varios pasos, Qwen 3 4B suele llevar ventaja pese a tener más o menos el mismo número de parámetros, y si necesitas margen real de razonamiento, Phi-4 14B es el salto evidente. La virtud que distingue a Phi-4 Mini es la eficiencia: rinde por encima de sus 3.8B en chat sencillo y resúmenes, manteniéndose lo bastante pequeño para correr casi en cualquier sitio, con licencia MIT y sin restricciones. Si buscas un asistente local diminuto que cargue rápido y no te estorbe, es una opción por defecto sólida.

Especificaciones

Parámetros3.8B
Ventana de contexto128K tokens
ProveedorMicrosoft
LicenciaMIT
Lanzamiento2025-02
Ideal paraChat

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.351.6 GB4 GBPérdida notable
Q4_K_MRecomendada4.852.3 GB6 GBRecomendada
Q5_K_M5.652.7 GB6 GBAlta
Q8_08.54.0 GB8 GBCasi original
F16167.6 GB12 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.4 GB~2.7 GB
8K tokens~0.8 GB~3.1 GB
32K tokens~3.0 GB~5.3 GB
128K tokens~12.0 GB~14.3 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~133 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~372 tok/s
Apple M-series (base)100 GB/s~37 tok/s
Apple M-series Pro270 GB/s~100 tok/s
Apple M-series Max410 GB/s~151 tok/s
CPU only (dual-channel DDR5)60 GB/s~22 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run phi4-mini

Preguntas frecuentes