← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Devstral 2 123B ?

Devstral 2 123B de Mistral AI demande environ 96 GB de RAM avec la quantisation 4 bits recommandée (74.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~5 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Le Devstral 2 123B est le gros modèle de code dense de Mistral, pensé pour les gens qui montent de vraies stations locales de programmation, pas pour la foule des portables. En 4-bit, il occupe environ 74.6 GB, et ça dit déjà tout : il ne tient ni sur une RTX 3060 de 12 GB ni sur une RTX 4090 de 24 GB, point final. Il te faut à peu près 96 GB de mémoire pour le charger confortablement, ce qui veut dire concrètement une machine Apple Silicon bien dotée en mémoire ou une workstation avec une RAM costaude. C'est un modèle autour duquel tu planifies ton matériel, pas un que tu télécharges par curiosité pour l'essayer.

Au quotidien, la réserve honnête, c'est la vitesse. Sur un Apple M Max, tu tournes autour de 5 tok/s, et une machine CPU seul en DDR5 chute à environ 1 tok/s, ce qui relève davantage du traitement par lots que du chat interactif. Il lit et écrit du code correctement, mais tu sentiras chaque réponse arriver lentement, goutte à goutte. La fenêtre de contexte est généreuse sur le papier, 256K, mais la vraie limite est la mémoire : monter à 128K de contexte réclame déjà environ 132 GB au total, donc sur une machine de 96 GB tu gardes le contexte de travail modeste et tu mises sur des prompts plus courts et ciblés.

Comparé au modèle MoE Qwen 3.5 122B-A10B présent dans related_models, le compromis est net : ce dernier n'active qu'une fraction de ses poids par token et paraît en général plus rapide à nombre de paramètres comparable, alors que le Devstral 2 fait tourner chacun de ses 123B paramètres à chaque token. La force de Devstral, c'est d'être un spécialiste du code dense et focalisé signé Mistral, avec un contexte long, à condition d'avoir la mémoire pour le nourrir. Une note pratique sur la licence : il est distribué sous une licence Modified MIT, donc lis les conditions précises avant tout usage commercial plutôt que de présumer la liberté du MIT classique.

Caractéristiques

Paramètres123B
Fenêtre de contexte256K tokens
ÉditeurMistral AI
LicenceModified MIT
Sortie2025-12
Idéal pourCode

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3551.5 GB96 GBPerte sensible
Q4_K_MRecommandée4.8574.6 GB96 GBRecommandée
Q5_K_M5.6586.9 GB128 GBÉlevée
Q8_08.5130.7 GB192 GBQuasi originale
F1616246.0 GB256 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~1.8 GB~76.4 GB
8K tokens~3.6 GB~78.2 GB
32K tokens~14.3 GB~88.9 GB
128K tokens~57.4 GB~132.0 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/sNe tient pas dans la VRAM
Apple M-series (base)100 GB/s~1 tok/s
Apple M-series Pro270 GB/s~3 tok/s
Apple M-series Max410 GB/s~5 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run devstral-2:123b

Questions fréquentes

Configuration requise pour Devstral 2 123B — Puis-je le faire tourner en local ?