← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Mistral Small 4 119B ?

Mistral Small 4 119B de Mistral AI demande environ 96 GB de RAM avec la quantisation 4 bits recommandée (72.1 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~88 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Mistral Small 4 119B est l'intrus de cette famille : « small » dans le nom, mais il embarque 119B de paramètres au total sous forme de mixture-of-experts qui n'en active que 6.5B par token. C'est cette architecture qui lui permet de dépasser sa taille active en vitesse, mais vous payez quand même le modèle entier en mémoire. En 4-bit, il pèse environ 72 GB, et il faut à peu près 96 GB de RAM pour le charger. Aucun GPU grand public ne le fait tenir : une RTX 3060 12 GB et même une RTX 4090 24 GB sont toutes deux hors course. C'est un modèle pour station de travail ou grosse machine à mémoire unifiée, pas un choix pour ordinateur portable.

À l'usage quotidien, l'astuce MoE paie là où ça compte. Sur un Apple M Max bien doté en mémoire, il tourne autour de 88 tokens par seconde, ce qui reste fluide pour un modèle de cette taille, et même sur CPU avec de la DDR5 vous obtenez environ 13 tokens par seconde si vous êtes patient. Le contexte de 256K est généreux sur le papier, mais surveillez la mémoire : à 128K de contexte, l'empreinte totale grimpe à environ 128.6 GB, donc la longue fenêtre n'est réelle que si vous avez la RAM pour la soutenir. Considérez le contexte complet comme une question de budget matériel, pas comme une option gratuite.

Face à sa propre lignée, Mistral 7B et Nemo 12B sont les options légères, limitées au chat, si vous ne pouvez pas fournir 96 GB ; ce modèle prend généralement l'avantage sur le raisonnement, le code et la vision, que ces deux-là ne gèrent pas du tout. Son rival le plus proche ici est Nemotron 3 Super 120B-A12B, un autre gros MoE de la même catégorie de poids ; les deux ont tendance à se rendre coup pour coup plutôt qu'à voir l'un dominer nettement. L'atout marquant, c'est que vous obtenez un modèle quatre tâches (chat, raisonnement, code, vision) sous une vraie licence Apache 2.0, donc les usages commercial et en production sont pleinement autorisés, sans contrainte imposée par le fournisseur.

Caractéristiques

Paramètres119B (6.5B actifs)
Fenêtre de contexte256K tokens
ÉditeurMistral AI
LicenceApache 2.0
Sortie2026-03
Idéal pourChat, Raisonnement, Code, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3549.8 GB64 GBPerte sensible
Q4_K_MRecommandée4.8572.1 GB96 GBRecommandée
Q5_K_M5.6584.0 GB128 GBÉlevée
Q8_08.5126.4 GB192 GBQuasi originale
F1616238.0 GB256 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~1.8 GB~73.9 GB
8K tokens~3.5 GB~75.6 GB
32K tokens~14.1 GB~86.2 GB
128K tokens~56.5 GB~128.6 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/sNe tient pas dans la VRAM
Apple M-series (base)100 GB/s~22 tok/s
Apple M-series Pro270 GB/s~58 tok/s
Apple M-series Max410 GB/s~88 tok/s
CPU only (dual-channel DDR5)60 GB/s~13 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Questions fréquentes