Puis-je faire tourner Mistral Small 3.1 24B ?
Mistral Small 3.1 24B de Mistral AI demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (14.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~24 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
Mistral Small 3.1 24B, c'est le modèle vers lequel on se tourne quand un modèle 8B vous déçoit régulièrement sur les prompts difficiles, mais sans vouloir passer à un 70B. C'est un modèle 24B de chat et de vision : il lit aussi bien les images que le texte, et il est distribué sous licence Apache 2.0, ce qui vous autorise un usage commercial et en production sans aucune contrainte. Le hic, c'est l'empreinte mémoire : en quantification 4-bit, il tourne autour de 14.6 GB, et il vous faut environ 24 GB de mémoire pour le faire tourner confortablement. Cela exclut une carte de 12 GB comme une RTX 3060, où il ne tient tout simplement pas, et vous oriente vers un GPU de 24 GB ou un Mac Apple Silicon doté d'une mémoire unifiée généreuse.
Sur une carte de 24 GB comme une RTX 4090, il avance à environ 59 tokens par seconde en 4-bit, ce qui défile plus vite que vous ne lisez et donne une vraie sensation de réactivité pour un modèle de cette taille. Sur une puce M-series Max, vous êtes plutôt autour de 24 tokens par seconde, ce qui reste parfaitement utilisable pour du chat interactif. En CPU seul sur de la DDR5, on tombe à environ 4 tokens par seconde : correct pour un traitement par lots durant la nuit, mais pas pour attendre devant l'écran. La fenêtre de contexte de 128K est bien réelle, mais coûteuse : remplissez-la entièrement et la mémoire totale grimpe à environ 42 GB, bien au-delà de ce dont le modèle a besoin sur un contexte court. Gardez donc votre contexte de travail modéré, sauf si vous avez de la marge à revendre.
Au sein de sa propre famille, c'est le poids lourd : Mistral Nemo 12B est le choix plus léger et plus rapide si vous êtes contraint par la mémoire, et Mistral 7B est l'option minimale, mais aucun des deux n'égale Small 3.1 sur le raisonnement difficile ou le suivi d'instructions. Gemma 4 26B A4B est le rival le plus proche en capacité brute et ajoute des atouts en code et en raisonnement, alors comparez les deux si ces tâches comptent le plus pour vous. La force distinctive de Small 3.1, c'est une combinaison que l'on obtient rarement ensemble : vision native, contexte long et licence Apache 2.0 totalement permissive, ce qui en fait l'un des modèles performants les plus faciles à réellement mettre en production dans un produit.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 14.6 GB | 24 GB | Recommandée |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Élevée |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Quasi originale |
| F16 | 16 | 48.0 GB | 64 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.9 GB | ~15.5 GB |
| 8K tokens | ~1.7 GB | ~16.3 GB |
| 32K tokens | ~6.9 GB | ~21.5 GB |
| 128K tokens | ~27.5 GB | ~42.1 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run mistral-small3.1Sources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Mistral AI.
github.comMistral AI — page officielle
Page officielle et documentation de Mistral AI.
mistral.ai