← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Ministral 3 14B ?

Ministral 3 14B de Mistral AI demande environ 16 GB de RAM avec la quantisation 4 bits recommandée (8.5 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~36 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Ministral 3 14B est le modèle de taille intermédiaire de Mistral sorti en décembre 2025 : un réseau dense de 14B paramètres qui gère aussi la vision. C'est donc le bon choix quand on veut un seul modèle local qui dialogue et lit des images, sans jongler avec deux checkpoints. En quantification 4-bit, il pèse environ 8.5 GB, soit un peu plus que ce qu'une carte de 8 GB encaisse confortablement, mais parfaitement à l'aise sur une RTX 3060 de 12 GB ou n'importe quel Mac Apple Silicon doté de 16 GB de mémoire unifiée ou plus. Si vous êtes à l'étroit, une version 2-bit le réduit à environ 5.9 GB ; la version q8, elle, avoisine plutôt les 15 GB.

À l'usage quotidien, il paraît rapide pour sa taille. Sur une RTX 3060 12 GB, comptez environ 36 tokens par seconde en 4-bit, soit nettement plus vite que la vitesse de lecture, tandis qu'une RTX 4090 monte à environ 101 tok/s. Un M-series Max tourne autour de 41 tok/s. La fenêtre de contexte de 256K est le chiffre vedette, mais voyez-la comme un plafond, pas comme une valeur par défaut : même à 128K, la mémoire totale grimpe à environ 30 GB une fois le cache KV rempli, bien au-delà d'un seul appareil de 12 GB ou 16 GB. Limitez le contexte de travail à quelques milliers de tokens, à moins de disposer d'une carte de 24 GB ou plus.

Face à ses voisins, Ministral 3 14B prend généralement l'avantage sur ses aînés comme Mistral 7B et Mistral Nemo 12B sur les prompts complexes et multi-étapes, simplement parce qu'il est plus grand et plus récent ; OLMo 2 13B reste l'alternative entièrement open-data si la reproductibilité compte plus pour vous que la capacité brute. Son vrai atout, c'est la vision intégrée à cette taille, avec un profil de vitesse réellement exploitable. Quant à la licence, c'est la partie facile : Apache 2.0, donc vous pouvez l'utiliser commercialement et en production sans aucune contrainte propre au fournisseur.

Caractéristiques

Paramètres14B
Fenêtre de contexte256K tokens
ÉditeurMistral AI
LicenceApache 2.0
Sortie2025-12
Idéal pourChat, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.355.9 GB12 GBPerte sensible
Q4_K_MRecommandée4.858.5 GB16 GBRecommandée
Q5_K_M5.659.9 GB16 GBÉlevée
Q8_08.514.9 GB24 GBQuasi originale
F161628.0 GB48 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.7 GB~9.2 GB
8K tokens~1.3 GB~9.8 GB
32K tokens~5.4 GB~13.9 GB
128K tokens~21.6 GB~30.1 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~36 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~101 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~27 tok/s
Apple M-series Max410 GB/s~41 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run ministral-3:14b

Questions fréquentes

Configuration requise pour Ministral 3 14B — Puis-je le faire tourner en local ?