← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Magistral Small 1.2 ?

Magistral Small 1.2 de Mistral AI demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (14.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~24 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Magistral Small 1.2 est le modèle de raisonnement 24B de Mistral, pensé pour ceux qui veulent un assistant local capable de vraiment dérouler des problèmes en plusieurs étapes plutôt que de simplement discuter. Il gère aussi la vision et la conversation générale, mais c'est le raisonnement qui justifie de l'adopter. L'empreinte mémoire est la première chose à anticiper : en quantification 4-bit, il avoisine 14.6 GB, et il faut environ 24 GB de mémoire pour le faire tourner confortablement. Cela exclut une carte de 12 GB comme une RTX 3060, où il ne tient tout simplement pas, et oriente vers un GPU de 24 GB ou un Mac Apple Silicon doté de plus de mémoire.

Sur une RTX 4090, il génère autour de 59 tokens par seconde, assez rapide pour que son raisonnement pas à pas ne donne jamais l'impression d'attendre. Sur un Mac de la série M Max, on est plus proche de 24 tokens par seconde, ce qui reste parfaitement exploitable en usage interactif, et en CPU seul sur DDR5, on tombe à environ 4 tokens par seconde, correct pour des traitements par lots mais pas pour du chat en direct. Le contexte de 128K est réel, mais gourmand en mémoire : remplissez-le et l'usage total grimpe à près de 42 GB, bien au-delà de ce qu'une seule carte de 24 GB peut contenir, donc gardez un contexte de travail modeste à moins d'avoir la marge nécessaire.

Face à ses cousins, Mistral Nemo 12B est le choix plus léger et plus rapide si vous voulez surtout du chat et ne pouvez pas vous permettre la mémoire, tandis que Gemma 4 26B A4B rivalise généralement de manière plus directe sur le raisonnement, le code et la vision pour une taille comparable. La force de Magistral, c'est cette orientation raisonnement dans un modèle que vous possédez entièrement : la licence Apache 2.0 vous permet de l'utiliser commercialement et en production sans aucune contrainte imposée par un fournisseur, ce qui est rare pour un modèle de raisonnement 24B de ce niveau. Si vous avez les 24 GB pour l'alimenter, c'est l'un des modèles de réflexion locaux les plus sérieux disponibles.

Caractéristiques

Paramètres24B
Fenêtre de contexte128K tokens
ÉditeurMistral AI
LicenceApache 2.0
Sortie2025-09
Idéal pourRaisonnement, Chat, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3510.1 GB16 GBPerte sensible
Q4_K_MRecommandée4.8514.6 GB24 GBRecommandée
Q5_K_M5.6517.0 GB24 GBÉlevée
Q8_08.525.5 GB48 GBQuasi originale
F161648.0 GB64 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.9 GB~15.5 GB
8K tokens~1.7 GB~16.3 GB
32K tokens~6.9 GB~21.5 GB
128K tokens~27.5 GB~42.1 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~59 tok/s
Apple M-series (base)100 GB/s~6 tok/s
Apple M-series Pro270 GB/s~16 tok/s
Apple M-series Max410 GB/s~24 tok/s
CPU only (dual-channel DDR5)60 GB/s~4 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Questions fréquentes