← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Phi-4 14B ?

Phi-4 14B de Microsoft demande environ 16 GB de RAM avec la quantisation 4 bits recommandée (8.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~34 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Phi-4 14B est le petit modèle de raisonnement de Microsoft, pensé pour ceux qui veulent une logique et une pensée structurée plus solides qu'un modèle de chat classique de 7-8B, sans pour autant passer à une machine de type station de travail. Avec 14.7B de paramètres, il pèse environ 8.9 GB en quantification 4-bit : il ne tient donc pas à l'aise sur une simple carte de 8 GB, et le plancher honnête reste les 16 GB de RAM minimum. Une RTX 3060 de 12 GB, un Mac Apple Silicon de 16 GB, ou tout GPU disposant d'un peu plus de 9 GB constituent son terrain naturel. Ne descendez à la version 2-bit autour de 6.2 GB que si vous êtes vraiment à l'étroit.

À l'usage quotidien, il paraît posé plutôt que vif, ce qui colle bien à sa vocation de raisonnement. Sur une RTX 3060 de 12 GB, comptez environ 34 tokens par seconde en 4-bit, confortable pour le chat et les problèmes pas à pas ; une RTX 4090 monte à près de 96, et une puce M-series Max se situe autour de 39. La vraie contrainte ici, c'est la fenêtre de contexte : à 16K, elle reste modeste selon les standards actuels, et remplir ne serait-ce que 8K fait grimper la mémoire totale à environ 10.3 GB. Gardez le contexte de travail léger et vous restez largement dans les limites d'une carte de 12 GB.

Face à Qwen 3 14B, de taille quasi identique et avec la même orientation chat et raisonnement, Phi-4 échange en général une large connaissance du monde contre un raisonnement serré et bien structuré sur les types de problèmes de maths et de logique pour lesquels Microsoft l'a ajusté ; Qwen paraît plus polyvalent sur les tâches ouvertes. Si vous cherchez plus léger, Phi-4 Mini 3.8B appartient à la même famille pour une fraction de l'empreinte. La force de Phi-4, c'est de jouer au-dessus de son nombre de paramètres sur le raisonnement structuré, et la licence MIT est la partie facile : librement utilisable, usage commercial inclus, sans aucune contrainte du fournisseur.

Caractéristiques

Paramètres14.7B
Fenêtre de contexte16K tokens
ÉditeurMicrosoft
LicenceMIT
Sortie2024-12
Idéal pourChat, Raisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.356.2 GB12 GBPerte sensible
Q4_K_MRecommandée4.858.9 GB16 GBRecommandée
Q5_K_M5.6510.4 GB16 GBÉlevée
Q8_08.515.6 GB24 GBQuasi originale
F161629.4 GB48 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.7 GB~9.6 GB
8K tokens~1.4 GB~10.3 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~96 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run phi4

Questions fréquentes