← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Codestral 22B ?

Codestral 22B de Mistral AI demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (13.5 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~26 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Codestral 22B est le modèle de Mistral AI dédié au code, conçu pour la complétion et la génération de code plutôt que pour la conversation libre. Avec 22,2 milliards de paramètres, il marque un vrai saut de taille par rapport aux modèles 7B-12B sur lesquels la plupart des gens débutent, et l'empreinte mémoire le confirme : une quantification 4-bit pèse environ 13.5 GB et le modèle réclame au moins 24 GB de RAM pour tourner confortablement. Cela le met hors de portée d'une carte 12 GB comme une RTX 3060, sur laquelle il ne tient tout simplement pas. Une carte 24 GB telle qu'une RTX 4090, ou un Mac Apple Silicon avec beaucoup de mémoire unifiée, constitue le point d'entrée réaliste.

Sur une RTX 4090, vous pouvez tabler sur environ 64 tok/s en 4-bit, assez rapide pour que les suggestions de code semblent quasi instantanées. Un Mac Apple série M Max descend plus bas, autour de 26 tok/s, ce qui reste utilisable pour de l'édition interactive, tandis qu'en CPU seul sur DDR5 on tombe à environ 4 tok/s, vraiment réservé aux traitements par lots que l'on peut lancer et laisser tourner. La fenêtre de contexte est de 32K, modeste selon les standards actuels mais généreuse pour la plupart des travaux sur un seul fichier ou un petit dépôt. Remplissez-la complètement et vous arrivez à environ 20.1 GB de mémoire totale, donc sur une carte 24 GB un contexte plein ne laisse que peu de marge.

Face à ses cousins de la même famille, Codestral est le spécialiste : Mistral Nemo 12B est le choix généraliste plus léger pour le chat si la mémoire vous manque, et GPT-OSS 20B garde généralement l'avantage pour le raisonnement et la conversation. Le point fort de Codestral, c'est d'avoir été entraîné spécifiquement pour le code dans de nombreux langages : pour la complétion fill-in-the-middle et la génération, il vise donc plus juste qu'un généraliste de taille équivalente. La réserve sérieuse concerne la licence : Codestral est distribué sous la MNPL de Mistral, une licence non-production, vous ne pouvez donc pas l'utiliser à des fins commerciales ni dans un produit en production. Considérez-le uniquement comme un outil de recherche et d'usage personnel.

Caractéristiques

Paramètres22.2B
Fenêtre de contexte32K tokens
ÉditeurMistral AI
LicenceMNPL (non-production)
Sortie2024-05
Idéal pourCode

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.359.3 GB16 GBPerte sensible
Q4_K_MRecommandée4.8513.5 GB24 GBRecommandée
Q5_K_M5.6515.7 GB24 GBÉlevée
Q8_08.523.6 GB32 GBQuasi originale
F161644.4 GB64 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.8 GB~14.3 GB
8K tokens~1.7 GB~15.2 GB
32K tokens~6.6 GB~20.1 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~64 tok/s
Apple M-series (base)100 GB/s~6 tok/s
Apple M-series Pro270 GB/s~17 tok/s
Apple M-series Max410 GB/s~26 tok/s
CPU only (dual-channel DDR5)60 GB/s~4 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run codestral

Questions fréquentes

Configuration requise pour Codestral 22B — Puis-je le faire tourner en local ?