← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Devstral Small 2 24B ?

Devstral Small 2 24B de Mistral AI demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (14.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~24 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Devstral Small 2 est le modèle de code 24B de Mistral, et son nom sous-estime largement le matériel qu'il réclame. En quantification 4-bit, les poids pèsent environ 14.6 GB, ce qui élimine d'emblée les cartes 12 GB de la plupart des gens : sur une RTX 3060, ça ne rentre tout simplement pas. Pour le faire tourner confortablement, il vous faut réalistement 24 GB de mémoire, autrement dit en pratique un GPU 24 GB comme une 4090, ou un Mac Apple Silicon avec au moins 24 GB de mémoire unifiée. Si vous descendez en 2-bit, la taille tombe à environ 10.1 GB, mais c'est un sacrifice de qualité sévère pour un modèle dont toute la raison d'être est de générer du code soigné.

Sur une 4090 en 4-bit, tablez sur environ 59 tok/s, un débit réellement agréable pour une boucle de codage agentique où le modèle lit des fichiers, planifie et édite. Sur un M Max, le chiffre se rapproche plutôt de ~24 tok/s : encore utilisable en interactif, mais sur les longues générations, la différence se sent. Le contexte de 256K mis en avant est bien réel et utile pour ingérer des dépôts entiers, mais soyez honnête sur son coût : dès 128K, la fiche technique situe la mémoire totale autour de 42.1 GB, soit bien au-delà d'une seule carte 24 GB. Voyez le grand contexte comme un outil auquel vous recourez sciemment, pas comme un réglage par défaut qu'on laisse ouvert.

Face à ses cousins, Devstral est le bon choix pour du travail sérieux : Mistral 7B et Mistral Nemo 12B sont plus légers et plus faciles à héberger, mais généralement plus faibles sur les tâches de code multi-étapes, tandis que Gemma 4 26B A4B est le concurrent le plus proche en code et en raisonnement, et vaut une comparaison côte à côte si vous avez la mémoire. Ce qui distingue Devstral, c'est qu'il a été conçu pour l'édition de code agentique avec usage d'outils plutôt que pour du chat one-shot, et cette orientation se voit dans sa façon de suivre un plan à travers plusieurs fichiers. Sa licence est Apache 2.0 : vous pouvez donc l'utiliser sans aucune restriction en commercial et en production, ce qui reste rare pour un modèle aussi capable.

Caractéristiques

Paramètres24B
Fenêtre de contexte256K tokens
ÉditeurMistral AI
LicenceApache 2.0
Sortie2025-12
Idéal pourCode, Chat, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3510.1 GB16 GBPerte sensible
Q4_K_MRecommandée4.8514.6 GB24 GBRecommandée
Q5_K_M5.6517.0 GB24 GBÉlevée
Q8_08.525.5 GB48 GBQuasi originale
F161648.0 GB64 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.9 GB~15.5 GB
8K tokens~1.7 GB~16.3 GB
32K tokens~6.9 GB~21.5 GB
128K tokens~27.5 GB~42.1 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~59 tok/s
Apple M-series (base)100 GB/s~6 tok/s
Apple M-series Pro270 GB/s~16 tok/s
Apple M-series Max410 GB/s~24 tok/s
CPU only (dual-channel DDR5)60 GB/s~4 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run devstral-small-2:24b

Questions fréquentes

Configuration requise pour Devstral Small 2 24B — Puis-je le faire tourner en local ?