← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Phi-4 Reasoning Vision 15B ?

Phi-4 Reasoning Vision 15B de Microsoft demande environ 16 GB de RAM avec la quantisation 4 bits recommandée (9.1 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~34 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Phi-4 Reasoning Vision 15B est le modèle à poids ouverts de Microsoft (sous licence MIT, donc librement exploitable en usage commercial), conçu pour la vision et le raisonnement plutôt que pour le chat généraliste. C'est un modèle dense de 15B paramètres, ce qui signifie que l'ensemble est chargé et sollicité à chaque token. En quantification 4-bit, il pèse environ 9.1 GB : visez une carte 12 GB comme une RTX 3060 pour le garder entièrement sur le GPU, avec au moins 16 GB de RAM système. Passez à une version 2-bit (environ 6.3 GB) si votre matériel est plus juste, sachant que la qualité en pâtit à ce niveau.

À l'usage quotidien, il reste vif sur une RTX 3060 de 12 GB, autour de 34 tokens par seconde en 4-bit, soit un confort de lecture aisé, tandis qu'une RTX 4090 de 24 GB grimpe à près de 94 tokens par seconde. Sur un Apple M-series Max, comptez environ 38 tokens par seconde. La fenêtre de contexte est de 16K, ce qui reste modeste : traitez-la comme un bloc-notes de travail plutôt qu'un endroit où déverser des documents entiers. Même à 8K de contexte, l'empreinte mémoire totale monte à environ 10.5 GB, alors gardez de la marge sur une carte 12 GB.

Face à ses cousins, Phi-4 14B et Qwen 3 14B sont les bons choix si vous voulez un modèle de chat et de raisonnement généraliste, car cette version sacrifie une partie de cette polyvalence au profit de la compréhension d'images. Phi-4 Mini 3.8B est l'option plus légère quand la mémoire est limitée. Son véritable atout : un raisonnement multimodal authentique pour une empreinte qui tient encore sur un seul GPU de milieu de gamme, et la licence MIT signifie aucune restriction commerciale à surveiller.

Caractéristiques

Paramètres15B
Fenêtre de contexte16K tokens
ÉditeurMicrosoft
LicenceMIT
Sortie2026-03
Idéal pourVision, Raisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.356.3 GB12 GBPerte sensible
Q4_K_MRecommandée4.859.1 GB16 GBRecommandée
Q5_K_M5.6510.6 GB16 GBÉlevée
Q8_08.515.9 GB24 GBQuasi originale
F161630.0 GB48 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.7 GB~9.8 GB
8K tokens~1.4 GB~10.5 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~94 tok/s
Apple M-series (base)100 GB/s~9 tok/s
Apple M-series Pro270 GB/s~25 tok/s
Apple M-series Max410 GB/s~38 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Questions fréquentes