Kann ich DeepSeek R1 8B lokal ausführen?
DeepSeek R1 8B von DeepSeek benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~63 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
DeepSeek R1 8B ist in erster Linie ein Reasoning-Modell und kein Allzweck-Chatpferd – diese Einordnung sollte man kennen, bevor man es herunterlädt. Es handelt sich um ein dichtes 8B-Modell, das in 4-Bit-Quantisierung bei rund 4.9 GB landet und mit reichlich Spielraum auf eine 8-GB-GPU passt. Die angegebenen 8 GB Mindest-RAM machen es auf einem bescheidenen Desktop oder jedem Apple-Silicon-Mac mit Unified Memory nutzbar. Die MIT-Lizenz ist der unkomplizierte Teil: kommerzieller Einsatz und Produktivbetrieb sind ohne Auflagen des Anbieters erlaubt. Greif zu, wenn du ein Modell willst, das ein Problem durchdenkt, statt nur schnell zu antworten.
Im Alltag wirkt es für seine Größe auf echter Hardware fix. Eine RTX 3060 12GB schafft etwa 63 tok/s, ein M-Max rund 72 tok/s und eine 4090 grob 177 tok/s – das Streaming wird also nie zum Flaschenhals. Auf der CPU mit DDR5 fällt es auf rund 11 tok/s, brauchbar für gelegentliche Anfragen, aber nicht für einen Dauerbetrieb. Der eigentliche Haken ist die Chain-of-Thought-Eigenheit: R1 denkt laut und frisst dadurch den Kontext schneller als ein reines Chatmodell. Das 128K-Fenster ist echt, doch wird es gefüllt, steigt der Gesamtspeicher auf etwa 21.7 GB – halte den Arbeitskontext also moderat, sofern du keinen Puffer hast.
Ehrlich eingeordnet ist das ein destilliertes Reasoning-Modell und kein Spitzenhirn im Kleinformat. Gegenüber Llama 3.1 8B tauscht es meist breite Gesprächsroutine und ausgereiftes Tooling gegen stärkeres schrittweises Reasoning ein; die kleineren DeepSeek R1 7B und 1.5B gibt es, wenn du leichter werden musst – auf Kosten der Tiefe. Sein herausragendes Merkmal ist die sichtbare Gedankenspur, die bei Mathematik, Logik und Debugging echten Nutzen bringt, wo man den Rechenweg sehen will. Wenn du vor allem schnellen, lockeren Chat willst, ist ein chat-optimiertes 8B die bessere Wahl; willst du ein lokales Modell, das wirklich nachdenkt, verdient sich R1 8B seinen Platz.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.9 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Nahezu Original |
| F16 | 16 | 16.0 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.4 GB |
| 8K Token | ~1.0 GB | ~5.9 GB |
| 32K Token | ~4.2 GB | ~9.1 GB |
| 128K Token | ~16.8 GB | ~21.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run deepseek-r1:8bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von DeepSeek.
github.comDeepSeek — offizielle Seite
Offizielle Seite und Dokumentation von DeepSeek.
deepseek.com