Puis-je faire tourner Ministral 3 14B ?
Ministral 3 14B de Mistral AI demande environ 16 GB de RAM avec la quantisation 4 bits recommandée (8.5 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~36 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Ministral 3 14B est le modèle de taille intermédiaire de Mistral sorti en décembre 2025 : un réseau dense de 14B paramètres qui gère aussi la vision. C'est donc le bon choix quand on veut un seul modèle local qui dialogue et lit des images, sans jongler avec deux checkpoints. En quantification 4-bit, il pèse environ 8.5 GB, soit un peu plus que ce qu'une carte de 8 GB encaisse confortablement, mais parfaitement à l'aise sur une RTX 3060 de 12 GB ou n'importe quel Mac Apple Silicon doté de 16 GB de mémoire unifiée ou plus. Si vous êtes à l'étroit, une version 2-bit le réduit à environ 5.9 GB ; la version q8, elle, avoisine plutôt les 15 GB.
À l'usage quotidien, il paraît rapide pour sa taille. Sur une RTX 3060 12 GB, comptez environ 36 tokens par seconde en 4-bit, soit nettement plus vite que la vitesse de lecture, tandis qu'une RTX 4090 monte à environ 101 tok/s. Un M-series Max tourne autour de 41 tok/s. La fenêtre de contexte de 256K est le chiffre vedette, mais voyez-la comme un plafond, pas comme une valeur par défaut : même à 128K, la mémoire totale grimpe à environ 30 GB une fois le cache KV rempli, bien au-delà d'un seul appareil de 12 GB ou 16 GB. Limitez le contexte de travail à quelques milliers de tokens, à moins de disposer d'une carte de 24 GB ou plus.
Face à ses voisins, Ministral 3 14B prend généralement l'avantage sur ses aînés comme Mistral 7B et Mistral Nemo 12B sur les prompts complexes et multi-étapes, simplement parce qu'il est plus grand et plus récent ; OLMo 2 13B reste l'alternative entièrement open-data si la reproductibilité compte plus pour vous que la capacité brute. Son vrai atout, c'est la vision intégrée à cette taille, avec un profil de vitesse réellement exploitable. Quant à la licence, c'est la partie facile : Apache 2.0, donc vous pouvez l'utiliser commercialement et en production sans aucune contrainte propre au fournisseur.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.9 GB | 12 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 8.5 GB | 16 GB | Recommandée |
| Q5_K_M | 5.65 | 9.9 GB | 16 GB | Élevée |
| Q8_0 | 8.5 | 14.9 GB | 24 GB | Quasi originale |
| F16 | 16 | 28.0 GB | 48 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.7 GB | ~9.2 GB |
| 8K tokens | ~1.3 GB | ~9.8 GB |
| 32K tokens | ~5.4 GB | ~13.9 GB |
| 128K tokens | ~21.6 GB | ~30.1 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~36 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~101 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~27 tok/s |
| Apple M-series Max | 410 GB/s | ~41 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run ministral-3:14b