Puis-je faire tourner Ministral 3 8B ?
Ministral 3 8B de Mistral AI demande environ 8 GB de RAM avec la quantisation 4 bits recommandée (4.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~63 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Ministral 3 8B est la réponse de Mistral, fin 2025, au petit modèle local polyvalent : il gère à la fois le chat et la vision dans un même format 8B. En quantification 4-bit, il pèse environ 4.9 GB, ce qui le fait tenir sur un GPU de 8 GB avec de la marge et tourner sans souci dans la mémoire unifiée de n'importe quel Mac Apple Silicon. Les 8 GB de RAM minimum annoncés sont honnêtes pour les poids seuls, ce qui en fait un choix réaliste pour un ordinateur portable ou un GPU d'occasion bon marché, plutôt qu'un modèle réservé à une station de travail.
À l'usage quotidien, il est rapide. Sur une RTX 3060, comptez environ 63 tokens par seconde en 4-bit ; une 4090 monte à près de 177, et une puce M-series Max se situe autour de 72 — dans tous les cas plus vite que vous ne lisez une réponse en streaming. L'argument phare, c'est la fenêtre de contexte de 256K, mais traitez-la comme un plafond, pas comme une valeur par défaut. À 128K de contexte, l'empreinte mémoire totale grimpe à environ 21.7 GB, bien au-delà de ce qu'une carte de 8 GB peut contenir : limitez donc le contexte de travail à quelques milliers de tokens, sauf si vous disposez de la VRAM pour soutenir la fenêtre longue.
Face à ses cousins, il trouve un juste milieu : Mistral Nemo 12B offre généralement plus de marge pour le raisonnement difficile si vous pouvez vous permettre le modèle plus lourd, tandis que Mistral 7B reste le repli plus léger quand la mémoire est limitée. La vraie force de Ministral 3 8B, c'est que la vision tient dans la même petite empreinte : vous bénéficiez de la compréhension d'images sans passer à un modèle multimodal plus exigeant. Il est distribué sous licence Apache 2.0, ce qui signifie que vous pouvez l'utiliser à des fins commerciales et en production sans aucune contrainte spécifique au fournisseur — une licence vraiment propre pour un modèle aussi capable.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 4.9 GB | 8 GB | Recommandée |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Élevée |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Quasi originale |
| F16 | 16 | 16.0 GB | 24 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.5 GB | ~5.4 GB |
| 8K tokens | ~1.0 GB | ~5.9 GB |
| 32K tokens | ~4.2 GB | ~9.1 GB |
| 128K tokens | ~16.8 GB | ~21.7 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run ministral-3:8b