¿Puedo ejecutar Phi-4 14B?
Phi-4 14B, de Microsoft, necesita alrededor de 16 GB de RAM con la cuantización recomendada de 4 bits (descarga de 8.9 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~34 tok/s en un NVIDIA RTX 3060 12GB.
Leyendo las señales de tu hardware…
Notas del mundo real
Phi-4 14B es el modelo de razonamiento compacto de Microsoft, pensado para quienes quieren una lógica y un pensamiento estructurado más sólidos de lo que ofrece un modelo de chat típico de 7-8B, sin tener que recurrir a algo que exija una estación de trabajo. Con 14.7B de parámetros, ronda los 8.9 GB en una cuantización de 4 bits, así que no entra con holgura en una tarjeta básica de 8 GB; la cifra de 16 GB de RAM mínima es el piso honesto. Una RTX 3060 de 12 GB, un Mac con Apple Silicon de 16 GB o cualquier GPU con margen por encima de 9 GB es su hogar natural. Baja a la versión de 2 bits, cerca de 6.2 GB, solo si vas muy justo de memoria.
En el uso diario se siente pausado más que ágil, lo cual encaja con su orientación al razonamiento. En una RTX 3060 de 12 GB cuenta con unos 34 tokens por segundo a 4 bits, cómodo para chat y problemas paso a paso; una RTX 4090 lo lleva a unos 96, y un chip M-series Max se sitúa cerca de 39. Aquí la verdadera limitación es la ventana de contexto: con 16K resulta modesta para los estándares actuales, e incluso llenar 8K eleva la memoria total a unos 10.3 GB. Mantén el contexto de trabajo ajustado y te quedas con margen dentro de una tarjeta de 12 GB.
Frente a Qwen 3 14B, de tamaño casi idéntico y con el mismo enfoque de chat y razonamiento, Phi-4 suele cambiar amplitud de conocimiento del mundo por un razonamiento compacto y bien estructurado en el tipo de problemas de matemáticas y lógica para los que Microsoft lo afinó; Qwen tiende a sentirse más versátil en tareas abiertas. Si quieres algo más ligero, Phi-4 Mini 3.8B es la misma familia con una fracción de la huella. El rasgo distintivo de Phi-4 es rendir por encima de su número de parámetros en razonamiento estructurado, y la licencia MIT es la parte fácil: de uso libre, incluido el trabajo comercial, sin condiciones del proveedor.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.2 GB | 12 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 8.9 GB | 16 GB | Recomendada |
| Q5_K_M | 5.65 | 10.4 GB | 16 GB | Alta |
| Q8_0 | 8.5 | 15.6 GB | 24 GB | Casi original |
| F16 | 16 | 29.4 GB | 48 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~0.7 GB | ~9.6 GB |
| 8K tokens | ~1.4 GB | ~10.3 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~96 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~26 tok/s |
| Apple M-series Max | 410 GB/s | ~39 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run phi4Fuentes y descargas
Ollama Library
Descarga y ejecuta el modelo con un solo comando.
ollama.comHugging Face
Pesos del modelo, archivos y detalles de la licencia.
huggingface.coRepositorio oficial en GitHub
Código fuente, releases e issues de Microsoft.
github.comMicrosoft — página oficial
Página oficial y documentación de Microsoft.
azure.microsoft.com