← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 4B lokal ausführen?

Qwen 3 4B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 6 GB RAM (2.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~126 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 4B ist das Modell der Wahl, wenn man echtes Reasoning aus etwas Kleinem herausholen will. Mit 4-Bit-Quantisierung landet es bei rund 2.4 GB und passt damit auf so gut wie alles: Eine 6-GB-GPU hat noch Luft, jeder Apple-Silicon-Mac verkraftet es mühelos, und selbst ein älteres Notebook mit integrierter Grafik kann es hosten. Für komfortables Arbeiten solltest du etwa 6 GB RAM einplanen. Wer nur eine reine CPU-Maschine oder ein Gerät der Raspberry-Klasse hat, findet hier eines der wenigen Modelle, das bei diesem Footprint wirklich brauchbar bleibt und nicht bloß technisch ladbar ist.

Im Alltag fühlt es sich flott an. Auf einer RTX 3060 schafft es bei 4-Bit grob 126 Tokens pro Sekunde, ein M-Max liegt bei etwa 144 tok/s, beides deutlich über Lesegeschwindigkeit, sodass Antworten bei Chat und kurzen Reasoning-Ketten praktisch sofort streamen. Eine 4090 erreicht rund 353 tok/s, falls du eine hast. Reine CPU auf DDR5 fällt auf etwa 21 Tokens pro Sekunde ab, langsam, aber für Hintergrundaufgaben tragbar. Das Kontextfenster liegt bei 32K, reichlich für die meisten Zwecke, doch füllt man es voll, steigt der Gesamtspeicher auf rund 5.5 GB, also halte den aktiven Kontext auf einer knappen 6-GB-Maschine moderat.

Innerhalb der eigenen Familie ist Qwen 3 4B der klare Schritt nach oben gegenüber Qwen 3 1.7B, sobald das kleinere Modell bei mehrstufigen Prompts ins Straucheln gerät, bleibt dabei aber weit leichter als die 7-8B-Klasse. Phi-4 Mini 3.8B ist eine vernünftige Alternative in ähnlicher Größe und liegt beim Chat meist gleichauf, doch die Stärke von Qwen 3 4B ist, dass es bei Reasoning-Aufgaben über seiner Parameterzahl boxt, gemessen daran, wie wenig der Betrieb kostet. Es kommt unter Apache 2.0, sodass du es kommerziell und in der Produktion ohne Lizenzsorgen nutzen kannst, was bei diesem Verhältnis von Qualität zu Größe selten ist.

Technische Daten

Parameter4B
Kontextfenster32K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.351.7 GB4 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.852.4 GB6 GBEmpfohlen
Q5_K_M5.652.8 GB6 GBHoch
Q8_08.54.3 GB8 GBNahezu Original
F16168.0 GB12 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.4 GB~2.8 GB
8K Token~0.8 GB~3.2 GB
32K Token~3.1 GB~5.5 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~126 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~353 tok/s
Apple M-series (base)100 GB/s~35 tok/s
Apple M-series Pro270 GB/s~95 tok/s
Apple M-series Max410 GB/s~144 tok/s
CPU only (dual-channel DDR5)60 GB/s~21 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:4b

Häufig gestellte Fragen