← Todos los modelosCOMPROBACIÓN DE MODELO

¿Puedo ejecutar Phi-4 14B?

Phi-4 14B, de Microsoft, necesita alrededor de 16 GB de RAM con la cuantización recomendada de 4 bits (descarga de 8.9 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~34 tok/s en un NVIDIA RTX 3060 12GB.

Leyendo las señales de tu hardware…

Notas del mundo real

Phi-4 14B es el modelo de razonamiento compacto de Microsoft, pensado para quienes quieren una lógica y un pensamiento estructurado más sólidos de lo que ofrece un modelo de chat típico de 7-8B, sin tener que recurrir a algo que exija una estación de trabajo. Con 14.7B de parámetros, ronda los 8.9 GB en una cuantización de 4 bits, así que no entra con holgura en una tarjeta básica de 8 GB; la cifra de 16 GB de RAM mínima es el piso honesto. Una RTX 3060 de 12 GB, un Mac con Apple Silicon de 16 GB o cualquier GPU con margen por encima de 9 GB es su hogar natural. Baja a la versión de 2 bits, cerca de 6.2 GB, solo si vas muy justo de memoria.

En el uso diario se siente pausado más que ágil, lo cual encaja con su orientación al razonamiento. En una RTX 3060 de 12 GB cuenta con unos 34 tokens por segundo a 4 bits, cómodo para chat y problemas paso a paso; una RTX 4090 lo lleva a unos 96, y un chip M-series Max se sitúa cerca de 39. Aquí la verdadera limitación es la ventana de contexto: con 16K resulta modesta para los estándares actuales, e incluso llenar 8K eleva la memoria total a unos 10.3 GB. Mantén el contexto de trabajo ajustado y te quedas con margen dentro de una tarjeta de 12 GB.

Frente a Qwen 3 14B, de tamaño casi idéntico y con el mismo enfoque de chat y razonamiento, Phi-4 suele cambiar amplitud de conocimiento del mundo por un razonamiento compacto y bien estructurado en el tipo de problemas de matemáticas y lógica para los que Microsoft lo afinó; Qwen tiende a sentirse más versátil en tareas abiertas. Si quieres algo más ligero, Phi-4 Mini 3.8B es la misma familia con una fracción de la huella. El rasgo distintivo de Phi-4 es rendir por encima de su número de parámetros en razonamiento estructurado, y la licencia MIT es la parte fácil: de uso libre, incluido el trabajo comercial, sin condiciones del proveedor.

Especificaciones

Parámetros14.7B
Ventana de contexto16K tokens
ProveedorMicrosoft
LicenciaMIT
Lanzamiento2024-12
Ideal paraChat, Razonamiento

Tamaño por cuantización

CuantizaciónBits/pesoDescargaRAM mínimaCalidad
Q2_K3.356.2 GB12 GBPérdida notable
Q4_K_MRecomendada4.858.9 GB16 GBRecomendada
Q5_K_M5.6510.4 GB16 GBAlta
Q8_08.515.6 GB24 GBCasi original
F161629.4 GB48 GBOriginal

Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →

Memoria necesaria según la longitud de contexto

ContextoCaché KV (est.)Memoria total (Q4)
4K tokens~0.7 GB~9.6 GB
8K tokens~1.4 GB~10.3 GB

La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.

Velocidad estimada según el hardware

HardwareAncho de banda~Velocidad
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~96 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.

Ejecútalo en local

El camino más fácil es Ollama — un comando y ya estás chateando:

ollama run phi4

Preguntas frecuentes

Requisitos de sistema de Phi-4 14B — ¿Puedo ejecutarlo en local?