← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 14B lokal ausführen?

Qwen 3 14B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (9.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 14B ist das Modell, zu dem man greift, wenn ein 8B etwas zu dünn wirkt, man aber nicht gleich zu einem Download der 30B-Klasse hochrüsten möchte. Mit 14,8B Parametern ist es ein dichtes Modell, also ist bei jedem Token das gesamte Netz aktiv, und bei einer 4-Bit-Quantisierung landet es bei rund 9 GB. Das ist für eine 12-GB-Karte einen Tick zu groß, um es mit viel Kontext bequem zu halten, läuft aber gut auf einer 16-GB-GPU und sitzt sauber im Unified Memory eines Apple-Silicon-Macs mit mehr RAM. Mindestens etwa 16 GB RAM solltest du einplanen. Es ist auf Chat und Reasoning ausgelegt, nicht auf Vision oder umfangreiche Codegenerierung.

Im Alltag wirkt es spürbar bedachter als ein kleines Modell, besonders bei mehrstufigen Prompts, wo sich sein Reasoning-Modus auszahlt. Auf einer RTX 3060 12GB kannst du bei 4-Bit mit rund 34 Token pro Sekunde rechnen, ein M-Series Max liegt mit etwa 39 knapp dahinter; ein 4090 treibt es auf etwa 95, deutlich jenseits der Lesegeschwindigkeit. Das 128K-Kontextfenster ist echt, aber teuer: Füllst du es, klettert der Gesamtspeicher auf rund 31 GB, sodass du bei allem unterhalb eines Setups mit 24 GB oder mehr den Arbeitskontext auf ein paar Tausend Token begrenzen solltest.

Gegenüber DeepSeek R1 14B, das dieselbe Parameterzahl hat, ist Qwen 3 14B die universellere Wahl: R1 neigt stärker zu langem Chain-of-Thought-Reasoning, während Qwen 3 14B im alltäglichen Chat und beim strukturierten Befolgen von Anweisungen insgesamt ausgewogener wirkt. Wenn du etwas deutlich Leichteres aus derselben Familie willst, senkt Qwen 3 1.7B den Speicherbedarf drastisch, allerdings auf Kosten der Tiefe. Das herausragende Merkmal von Qwen 3 14B ist, dass es unter Apache 2.0 ausgeliefert wird, sodass du es kommerziell und in der Produktion ohne anbieterspezifische Auflagen einsetzen kannst, was auf diesem Leistungsniveau selten ist.

Technische Daten

Parameter14.8B
Kontextfenster128K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.356.2 GB12 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.859.0 GB16 GBEmpfohlen
Q5_K_M5.6510.5 GB16 GBHoch
Q8_08.515.7 GB24 GBNahezu Original
F161629.6 GB48 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.7 GB~9.7 GB
8K Token~1.4 GB~10.4 GB
32K Token~5.5 GB~14.5 GB
128K Token~22.1 GB~31.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~95 tok/s
Apple M-series (base)100 GB/s~9 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:14b

Häufig gestellte Fragen