Puis-je faire tourner Devstral 2 123B ?
Devstral 2 123B de Mistral AI demande environ 96 GB de RAM avec la quantisation 4 bits recommandée (74.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~5 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
Le Devstral 2 123B est le gros modèle de code dense de Mistral, pensé pour les gens qui montent de vraies stations locales de programmation, pas pour la foule des portables. En 4-bit, il occupe environ 74.6 GB, et ça dit déjà tout : il ne tient ni sur une RTX 3060 de 12 GB ni sur une RTX 4090 de 24 GB, point final. Il te faut à peu près 96 GB de mémoire pour le charger confortablement, ce qui veut dire concrètement une machine Apple Silicon bien dotée en mémoire ou une workstation avec une RAM costaude. C'est un modèle autour duquel tu planifies ton matériel, pas un que tu télécharges par curiosité pour l'essayer.
Au quotidien, la réserve honnête, c'est la vitesse. Sur un Apple M Max, tu tournes autour de 5 tok/s, et une machine CPU seul en DDR5 chute à environ 1 tok/s, ce qui relève davantage du traitement par lots que du chat interactif. Il lit et écrit du code correctement, mais tu sentiras chaque réponse arriver lentement, goutte à goutte. La fenêtre de contexte est généreuse sur le papier, 256K, mais la vraie limite est la mémoire : monter à 128K de contexte réclame déjà environ 132 GB au total, donc sur une machine de 96 GB tu gardes le contexte de travail modeste et tu mises sur des prompts plus courts et ciblés.
Comparé au modèle MoE Qwen 3.5 122B-A10B présent dans related_models, le compromis est net : ce dernier n'active qu'une fraction de ses poids par token et paraît en général plus rapide à nombre de paramètres comparable, alors que le Devstral 2 fait tourner chacun de ses 123B paramètres à chaque token. La force de Devstral, c'est d'être un spécialiste du code dense et focalisé signé Mistral, avec un contexte long, à condition d'avoir la mémoire pour le nourrir. Une note pratique sur la licence : il est distribué sous une licence Modified MIT, donc lis les conditions précises avant tout usage commercial plutôt que de présumer la liberté du MIT classique.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 51.5 GB | 96 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 74.6 GB | 96 GB | Recommandée |
| Q5_K_M | 5.65 | 86.9 GB | 128 GB | Élevée |
| Q8_0 | 8.5 | 130.7 GB | 192 GB | Quasi originale |
| F16 | 16 | 246.0 GB | 256 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~1.8 GB | ~76.4 GB |
| 8K tokens | ~3.6 GB | ~78.2 GB |
| 32K tokens | ~14.3 GB | ~88.9 GB |
| 128K tokens | ~57.4 GB | ~132.0 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Ne tient pas dans la VRAM |
| Apple M-series (base) | 100 GB/s | ~1 tok/s |
| Apple M-series Pro | 270 GB/s | ~3 tok/s |
| Apple M-series Max | 410 GB/s | ~5 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~1 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run devstral-2:123b