Puis-je faire tourner Command R 35B ?
Command R 35B de Cohere demande environ 32 GB de RAM avec la quantisation 4 bits recommandée (21.2 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~16 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
Command R 35B est le cheval de trait RAG-et-chat de Cohere, et il exige bien plus de votre matériel que les modèles 7-8B par lesquels la plupart des gens commencent. En 4-bit, il pèse environ 21 GB : la RTX 3060 de 12 GB est donc totalement hors course, et il vous faut au moins 32 GB de RAM système pour le charger confortablement. Son foyer réaliste, c'est une carte de 24 GB comme une RTX 4090, ou un Mac Apple Silicon doté d'une généreuse mémoire unifiée. Ne descendez à une quantisation 2-bit (environ 15 GB) que si vous êtes vraiment à l'étroit et prêt à accepter la perte de qualité.
À l'usage quotidien, il est régulier plutôt que vif. Sur une RTX 4090, comptez autour de 40 tokens par seconde en 4-bit, ce qui défile plus vite que vous ne lisez ; sur un M-series Max, il se stabilise vers 16 tok/s, exploitable mais nettement plus posé ; et sur un CPU en DDR5, vous tournez autour de 2 tok/s, soit un vrai test de patience. La fenêtre de contexte de 128K est réellement vaste, mais coûteuse à exploiter : remplissez-la et la mémoire totale grimpe à environ 54 GB. À moins de disposer d'une configuration de 48 GB ou plus, gardez donc un contexte de travail modeste et réservez la fenêtre complète aux longs documents occasionnels.
Face à la production actuelle, il accuse son âge de 2024. Les modèles Qwen 3.5 et 3.6 35B-A3B de la liste associée sont des architectures MoE qui semblent généralement plus rapides et plus solides en raisonnement et en code, deux domaines qui n'ont jamais été la priorité de Command R. Sa qualité marquante reste ce pour quoi Cohere l'a conçu : le chat à génération augmentée par récupération, ancré et sourcé, avec citations, où il a tendance à rester fidèle aux sources plutôt qu'à divaguer. Une réserve de taille, toutefois : les poids sont sous licence CC-BY-NC, donc strictement non commerciale. Vous pouvez l'utiliser pour des projets personnels et de la recherche, mais pas l'intégrer dans un produit ni dans le moindre service payant.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 21.2 GB | 32 GB | Recommandée |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Élevée |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Quasi originale |
| F16 | 16 | 70.0 GB | 96 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~22.2 GB |
| 8K tokens | ~2.0 GB | ~23.2 GB |
| 32K tokens | ~8.1 GB | ~29.3 GB |
| 128K tokens | ~32.6 GB | ~53.8 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~40 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~16 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~2 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run command-r