Kann ich DeepSeek R1 70B lokal ausführen?
DeepSeek R1 70B von DeepSeek benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (42.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~8 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
DeepSeek R1 70B ist das Modell, zu dem du greifst, wenn du Chain-of-Thought-Reasoning vollständig auf eigener Hardware laufen lassen willst und keinen schnellen Chat-Helfer suchst. In 4-Bit wiegt es rund 42.8 GB und braucht mindestens etwa 64 GB RAM, was eine einzelne Consumer-GPU von vornherein ausschließt: Auf einer RTX 3060 12GB oder selbst einer RTX 4090 24GB passt es schlicht nicht. Sein realistisches Zuhause ist ein Mac mit reichlich Unified Memory oder eine Workstation mit 64 GB oder mehr, wo der komplette Satz an Gewichten tatsächlich resident bleiben kann. Das ist eine ernsthafte Investition, kein beiläufiger Download.
Im Alltag lautet die ehrliche Schlagzeile: Es ist langsam. Auf einem Apple M-Max bewegst du dich bei rund 8 Tokens pro Sekunde, auf einer CPU mit DDR5 fällt es auf etwa 1 Token pro Sekunde, sodass Antworten bestenfalls im Lesetempo eintreffen und im schlimmsten Fall kriechen. Weil R1 vor der Antwort laut nachdenkt, fließt ein Großteil dieser Tokens in sichtbares Reasoning, sodass eine einzelne Antwort schon mal dauern kann. Die 128K-Kontextlänge ist vorhanden, doch sie zu füllen treibt den Gesamtspeicher auf etwa 87.5 GB, deutlich über die 64-GB-Untergrenze hinaus. Halte den Arbeitskontext also moderat, sofern du keinen Spielraum übrig hast.
Innerhalb der eigenen Familie ist die Abwägung eindeutig: DeepSeek R1 7B oder das winzige 1.5B laufen deutlich schneller und passen auf bescheidene Hardware, aber dieses 70B schlägt sich bei härterem mehrstufigem Reasoning in der Regel besser, wo die kleineren Distillate gern den Faden verlieren. Verglichen mit Llama 3.1 70B, das auf Chat getrimmt ist, ist das herausragende Merkmal von R1 70B dieser explizite Reasoning-Stil, der sich besser für Mathe- und Logikaufgaben eignet als für offene Konversation. Die MIT-Lizenz ist hier der einfache Teil: Du darfst es kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen. Plane nur Speicher und Wartezeit fest ein.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 29.6 GB | 48 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 42.8 GB | 64 GB | Empfohlen |
| Q5_K_M | 5.65 | 49.9 GB | 64 GB | Hoch |
| Q8_0 | 8.5 | 75.0 GB | 96 GB | Nahezu Original |
| F16 | 16 | 141.2 GB | 192 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.4 GB | ~44.2 GB |
| 8K Token | ~2.8 GB | ~45.6 GB |
| 32K Token | ~11.2 GB | ~54.0 GB |
| 128K Token | ~44.7 GB | ~87.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~2 tok/s |
| Apple M-series Pro | 270 GB/s | ~5 tok/s |
| Apple M-series Max | 410 GB/s | ~8 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~1 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run deepseek-r1:70bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von DeepSeek.
github.comDeepSeek — offizielle Seite
Offizielle Seite und Dokumentation von DeepSeek.
deepseek.com