← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Mistral Nemo 12B ?

Mistral Nemo 12B de Mistral AI demande environ 12 GB de RAM avec la quantisation 4 bits recommandée (7.4 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~41 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Mistral Nemo 12B, c'est le modèle vers lequel on se tourne quand un 8B paraît un peu juste mais qu'on veut toujours quelque chose qui tient sur un seul GPU grand public. Il s'agit d'un modèle de chat dense de 12,2B signé Mistral AI, et en quantification 4 bits il pèse environ 7.4 GB, ce qui se loge sans peine sur une carte de 12 GB comme une RTX 3060, avec de la marge pour le contexte. Le minimum pour le charger avoisine 12 GB de RAM : il est donc à l'aise sur un Mac Apple Silicon doté de 16 GB ou plus, et il avancera tant bien que mal sur CPU si vous n'avez rien d'autre.

Au quotidien, il donne l'impression d'un assistant généraliste bien élevé : régulier pour le chat, le résumé et la réécriture, sans les ratés occasionnels des modèles plus petits. Sur une RTX 3060, comptez environ 41 tokens par seconde en 4 bits, et un M-series Max pousse cela à près de 47, dans les deux cas plus vite que vous ne lisez. La fenêtre de contexte de 128K est bien réelle, mais elle n'est pas gratuite : remplissez-la entièrement et la mémoire totale grimpe autour de 27.7 GB, bien au-delà de ce que contient une seule carte de 12 GB. Gardez donc un contexte de travail modeste, sauf si vous disposez d'un GPU de 24 GB ou d'une mémoire unifiée abondante.

Face à ses voisins, Mistral Small 3.1 24B prend généralement l'avantage sur le raisonnement plus difficile et ajoute la vision, tandis que Gemma 3 12B est l'alternative de taille comparable si vous voulez l'entrée d'image que Nemo n'offre pas. La grande force de Nemo, c'est son juste équilibre : un 12B orienté chat qui reste sur un seul GPU grand public et qui est distribué sous Apache 2.0, ce qui vous permet de l'utiliser commercialement et en production sans aucune contrainte. Si vous cherchez un assistant texte capable qui fonctionne simplement en local et ne soulève jamais la moindre question de licence, c'est un choix évident.

Caractéristiques

Paramètres12.2B
Fenêtre de contexte128K tokens
ÉditeurMistral AI
LicenceApache 2.0
Sortie2024-07
Idéal pourChat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.355.1 GB8 GBPerte sensible
Q4_K_MRecommandée4.857.4 GB12 GBRecommandée
Q5_K_M5.658.6 GB16 GBÉlevée
Q8_08.513.0 GB24 GBQuasi originale
F161624.4 GB32 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.6 GB~8.0 GB
8K tokens~1.3 GB~8.7 GB
32K tokens~5.1 GB~12.5 GB
128K tokens~20.3 GB~27.7 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~41 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~116 tok/s
Apple M-series (base)100 GB/s~11 tok/s
Apple M-series Pro270 GB/s~31 tok/s
Apple M-series Max410 GB/s~47 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run mistral-nemo

Questions fréquentes