Puis-je faire tourner Mellum 2 12B-A2.5B ?
Mellum 2 12B-A2.5B de JetBrains demande environ 12 GB de RAM avec la quantisation 4 bits recommandée (7.3 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~202 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Mellum 2 est le modèle de JetBrains dédié au code, conçu comme un mixture-of-experts : 12B de paramètres au total, mais seulement environ 2,5B actifs par token. C'est tout l'intérêt de cette architecture. Vous obtenez la vitesse d'un modèle d'environ 2-3B, mais vous gardez les 12B complets en mémoire, alors ne vous laissez pas tromper par le nombre de paramètres actifs. En quantification 4-bit, il pèse autour de 7,3 GB, avec un plancher pratique d'environ 12 GB de RAM. Cela tient sur une carte de 12 GB comme une RTX 3060 ou sur la mémoire unifiée d'un Mac Apple Silicon, mais 8 GB sont trop justes. Si vous vivez dans les IDE JetBrains et voulez de la complétion de code en local, il vous vise directement.
À l'usage quotidien, l'architecture MoE porte ses fruits : il paraît bien plus rapide que ne le laisse penser sa taille. Sur une RTX 3060 12GB, comptez environ 202 tokens par seconde en 4-bit, et une RTX 4090 dépasse les 565 — largement dans la zone où la complétion arrive avant que vous ayez fini de taper la ligne suivante. Le contexte de 128K est réellement grand pour un modèle de code, pratique pour lui donner des fichiers entiers ou tous les en-têtes d'un dépôt, mais ce n'est pas gratuit. Remplissez-le à fond et la mémoire totale grimpe à environ 27,4 GB, bien au-delà de ce que contient une seule carte de 12 GB ; gardez donc un contexte de travail modeste, sauf si vous avez un GPU de 24 GB ou une mémoire unifiée généreuse.
Soyons clairs sur le périmètre : c'est un spécialiste du code, pas un assistant généraliste. Pour le chat, le raisonnement ou tout ce qui touche aux images, un modèle 12B plus polyvalent comme Gemma 4 12B vous servira généralement mieux, et Mistral Nemo 12B reste le choix le plus à l'aise pour la conversation ouverte. La force de Mellum 2, c'est ce rapport vitesse/taille du MoE sur le travail de complétion, associé à une intégration IDE de premier ordre signée par ceux qui font votre éditeur. Et la licence est la partie facile : Apache 2.0, donc vous pouvez l'utiliser commercialement et en production sans souci juridique. Si votre métier, c'est le code et que vous avez une carte de 12 GB, c'est un choix local solide et rapide.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.0 GB | 8 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 7.3 GB | 12 GB | Recommandée |
| Q5_K_M | 5.65 | 8.5 GB | 16 GB | Élevée |
| Q8_0 | 8.5 | 12.8 GB | 24 GB | Quasi originale |
| F16 | 16 | 24.0 GB | 32 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.6 GB | ~7.9 GB |
| 8K tokens | ~1.3 GB | ~8.6 GB |
| 32K tokens | ~5.0 GB | ~12.3 GB |
| 128K tokens | ~20.1 GB | ~27.4 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~202 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~565 tok/s |
| Apple M-series (base) | 100 GB/s | ~56 tok/s |
| Apple M-series Pro | 270 GB/s | ~151 tok/s |
| Apple M-series Max | 410 GB/s | ~230 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~34 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.