← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Command R 35B ?

Command R 35B de Cohere demande environ 32 GB de RAM avec la quantisation 4 bits recommandée (21.2 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~16 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

Command R 35B est le cheval de trait RAG-et-chat de Cohere, et il exige bien plus de votre matériel que les modèles 7-8B par lesquels la plupart des gens commencent. En 4-bit, il pèse environ 21 GB : la RTX 3060 de 12 GB est donc totalement hors course, et il vous faut au moins 32 GB de RAM système pour le charger confortablement. Son foyer réaliste, c'est une carte de 24 GB comme une RTX 4090, ou un Mac Apple Silicon doté d'une généreuse mémoire unifiée. Ne descendez à une quantisation 2-bit (environ 15 GB) que si vous êtes vraiment à l'étroit et prêt à accepter la perte de qualité.

À l'usage quotidien, il est régulier plutôt que vif. Sur une RTX 4090, comptez autour de 40 tokens par seconde en 4-bit, ce qui défile plus vite que vous ne lisez ; sur un M-series Max, il se stabilise vers 16 tok/s, exploitable mais nettement plus posé ; et sur un CPU en DDR5, vous tournez autour de 2 tok/s, soit un vrai test de patience. La fenêtre de contexte de 128K est réellement vaste, mais coûteuse à exploiter : remplissez-la et la mémoire totale grimpe à environ 54 GB. À moins de disposer d'une configuration de 48 GB ou plus, gardez donc un contexte de travail modeste et réservez la fenêtre complète aux longs documents occasionnels.

Face à la production actuelle, il accuse son âge de 2024. Les modèles Qwen 3.5 et 3.6 35B-A3B de la liste associée sont des architectures MoE qui semblent généralement plus rapides et plus solides en raisonnement et en code, deux domaines qui n'ont jamais été la priorité de Command R. Sa qualité marquante reste ce pour quoi Cohere l'a conçu : le chat à génération augmentée par récupération, ancré et sourcé, avec citations, où il a tendance à rester fidèle aux sources plutôt qu'à divaguer. Une réserve de taille, toutefois : les poids sont sous licence CC-BY-NC, donc strictement non commerciale. Vous pouvez l'utiliser pour des projets personnels et de la recherche, mais pas l'intégrer dans un produit ni dans le moindre service payant.

Caractéristiques

Paramètres35B
Fenêtre de contexte128K tokens
ÉditeurCohere
LicenceCC-BY-NC
Sortie2024-08
Idéal pourChat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3514.7 GB24 GBPerte sensible
Q4_K_MRecommandée4.8521.2 GB32 GBRecommandée
Q5_K_M5.6524.7 GB48 GBÉlevée
Q8_08.537.2 GB48 GBQuasi originale
F161670.0 GB96 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~1.0 GB~22.2 GB
8K tokens~2.0 GB~23.2 GB
32K tokens~8.1 GB~29.3 GB
128K tokens~32.6 GB~53.8 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~40 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~11 tok/s
Apple M-series Max410 GB/s~16 tok/s
CPU only (dual-channel DDR5)60 GB/s~2 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run command-r

Questions fréquentes

Configuration requise pour Command R 35B — Puis-je le faire tourner en local ?