Kann ich Qwen 3 4B lokal ausführen?
Qwen 3 4B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 6 GB RAM (2.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~126 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3 4B ist das Modell der Wahl, wenn man echtes Reasoning aus etwas Kleinem herausholen will. Mit 4-Bit-Quantisierung landet es bei rund 2.4 GB und passt damit auf so gut wie alles: Eine 6-GB-GPU hat noch Luft, jeder Apple-Silicon-Mac verkraftet es mühelos, und selbst ein älteres Notebook mit integrierter Grafik kann es hosten. Für komfortables Arbeiten solltest du etwa 6 GB RAM einplanen. Wer nur eine reine CPU-Maschine oder ein Gerät der Raspberry-Klasse hat, findet hier eines der wenigen Modelle, das bei diesem Footprint wirklich brauchbar bleibt und nicht bloß technisch ladbar ist.
Im Alltag fühlt es sich flott an. Auf einer RTX 3060 schafft es bei 4-Bit grob 126 Tokens pro Sekunde, ein M-Max liegt bei etwa 144 tok/s, beides deutlich über Lesegeschwindigkeit, sodass Antworten bei Chat und kurzen Reasoning-Ketten praktisch sofort streamen. Eine 4090 erreicht rund 353 tok/s, falls du eine hast. Reine CPU auf DDR5 fällt auf etwa 21 Tokens pro Sekunde ab, langsam, aber für Hintergrundaufgaben tragbar. Das Kontextfenster liegt bei 32K, reichlich für die meisten Zwecke, doch füllt man es voll, steigt der Gesamtspeicher auf rund 5.5 GB, also halte den aktiven Kontext auf einer knappen 6-GB-Maschine moderat.
Innerhalb der eigenen Familie ist Qwen 3 4B der klare Schritt nach oben gegenüber Qwen 3 1.7B, sobald das kleinere Modell bei mehrstufigen Prompts ins Straucheln gerät, bleibt dabei aber weit leichter als die 7-8B-Klasse. Phi-4 Mini 3.8B ist eine vernünftige Alternative in ähnlicher Größe und liegt beim Chat meist gleichauf, doch die Stärke von Qwen 3 4B ist, dass es bei Reasoning-Aufgaben über seiner Parameterzahl boxt, gemessen daran, wie wenig der Betrieb kostet. Es kommt unter Apache 2.0, sodass du es kommerziell und in der Produktion ohne Lizenzsorgen nutzen kannst, was bei diesem Verhältnis von Qualität zu Größe selten ist.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.7 GB | 4 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 2.4 GB | 6 GB | Empfohlen |
| Q5_K_M | 5.65 | 2.8 GB | 6 GB | Hoch |
| Q8_0 | 8.5 | 4.3 GB | 8 GB | Nahezu Original |
| F16 | 16 | 8.0 GB | 12 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.4 GB | ~2.8 GB |
| 8K Token | ~0.8 GB | ~3.2 GB |
| 32K Token | ~3.1 GB | ~5.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3:4bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai