Kann ich DeepSeek R1 14B lokal ausführen?
DeepSeek R1 14B von DeepSeek benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (9.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
DeepSeek R1 14B ist ein Reasoning-Modell, kein flotter Chat-Begleiter. Mit 14.8B Parametern liegt es in der unbequemen Mitte: Eine 4-Bit-Quantisierung landet bei rund 9 GB und sprengt damit eine 12-GB-Karte, sobald Kontext dazukommt; empfohlen sind mindestens 16 GB RAM. Auf einer 24-GB-GPU wie der RTX 4090 oder einem Apple-Silicon-Mac mit mehr Speicher läuft es sauber, doch auf einer 12-GB-RTX 3060 bewegst du dich am Limit. Die MIT-Lizenz ist der einfache Teil: frei nutzbar, auch kommerziell, ohne Auflagen des Anbieters.
Im Alltag denkt es laut, bevor es antwortet, also rechne bei jedem Prompt mit langen Ketten von Reasoning-Tokens. Auf einer RTX 4090 erreichst du rund 95 tok/s, schnell genug, dass das Reasoning nur so durchläuft; auf einer RTX 3060 fällt es auf etwa 34 tok/s und auf einem M-Max-Mac auf grob 39 tok/s, wo sich die langen Gedankengänge zäh anfühlen. Die 128K Kontext sind echt, aber teuer: Füllt man sie aus, steigt der Gesamtspeicher auf etwa 31.1 GB, weit jenseits jedes 16-GB-Setups. Halte den Arbeitskontext also knapp, sofern du keine Maschine mit 32 GB oder mehr hast.
Gegenüber Qwen 3 14B, das dieselben 14.8B Parameter mitbringt, aber auch normalen Chat beherrscht, ist R1 14B die spezialisiertere Wahl: Bei mehrstufiger Mathematik und Logik zahlt es sich meist aus, wirkt aber schwerfällig im einfachen Hin und Her, wo Qwen tendenziell schneller und direkter ist. Seine herausragende Stärke ist nachvollziehbares Reasoning in einer Größe, die du tatsächlich selbst hosten kannst. Willst du denselben Ansatz leichter, halbiert DeepSeek R1 7B die Parameterzahl grob und passt bequemer auf eine 12-GB-Karte.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.2 GB | 12 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 9.0 GB | 16 GB | Empfohlen |
| Q5_K_M | 5.65 | 10.5 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 15.7 GB | 24 GB | Nahezu Original |
| F16 | 16 | 29.6 GB | 48 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.7 GB | ~9.7 GB |
| 8K Token | ~1.4 GB | ~10.4 GB |
| 32K Token | ~5.5 GB | ~14.5 GB |
| 128K Token | ~22.1 GB | ~31.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~95 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~26 tok/s |
| Apple M-series Max | 410 GB/s | ~39 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run deepseek-r1:14bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von DeepSeek.
github.comDeepSeek — offizielle Seite
Offizielle Seite und Dokumentation von DeepSeek.
deepseek.com