Kann ich Command R 35B lokal ausführen?
Command R 35B von Cohere benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (21.2 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~16 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Command R 35B ist Coheres Arbeitstier für RAG und Chat und verlangt deutlich mehr von deiner Hardware als die 7-8B-Modelle, mit denen die meisten starten. In 4-bit belegt es rund 21 GB, womit die RTX 3060 mit 12 GB komplett ausfällt, und du brauchst mindestens 32 GB System-RAM, um es bequem zu laden. Realistisch zu Hause ist es auf einer 24-GB-Karte wie der RTX 4090 zu betreiben oder auf einem Apple-Silicon-Mac mit reichlich Unified Memory. Auf eine 2-bit-Quantisierung (etwa 15 GB) solltest du nur ausweichen, wenn es eng wird und du den Qualitätsverlust in Kauf nimmst.
Im Alltag wirkt es solide, aber nicht spritzig. Auf einer RTX 4090 kannst du in 4-bit mit rund 40 tok/s rechnen, was schneller streamt, als du liest; auf einem M-Max pendelt es sich bei etwa 16 tok/s ein, nutzbar, aber spürbar gemächlicher; und auf einer CPU mit DDR5 landest du bei ungefähr 2 tok/s, also im geduldsfordernden Bereich. Das 128K-Kontextfenster ist wirklich groß, aber teuer in der Nutzung: Füllst du es, klettert der Gesamtspeicher auf etwa 54 GB. Halte den Arbeitskontext daher knapp und reserviere das volle Fenster für gelegentliche lange Dokumente, sofern du kein Setup mit 48 GB oder mehr hast.
Gegen das aktuelle Feld zeigt es sein Baujahr 2024. Die Modelle Qwen 3.5 und 3.6 35B-A3B aus der verwandten Liste sind MoE-Designs, die sich beim Reasoning und Coding meist schneller und stärker anfühlen, worauf Command R nie ausgelegt war. Seine herausragende Stärke bleibt das, wofür Cohere es gebaut hat: fundierter, retrieval-augmentierter Chat mit Quellenangaben, bei dem es eher an der Quelle bleibt, statt abzuschweifen. Ein harter Vorbehalt jedoch: Die Gewichte stehen unter CC-BY-NC, das heißt ausschließlich nicht-kommerziell. Du kannst es für persönliche Projekte und Forschung nutzen, aber nicht in einem Produkt oder einem kostenpflichtigen Dienst ausliefern.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 21.2 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Hoch |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Nahezu Original |
| F16 | 16 | 70.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~22.2 GB |
| 8K Token | ~2.0 GB | ~23.2 GB |
| 32K Token | ~8.1 GB | ~29.3 GB |
| 128K Token | ~32.6 GB | ~53.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~40 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~16 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~2 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run command-r