← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 0.6B lokal ausführen?

Qwen 3 0.6B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 2 GB RAM (0.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~841 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 0.6B ist ein wirklich winziges Modell, und genau das ist der Sinn. In 4-Bit belegt es rund 0,4 GB, und selbst ein q8-Build kommt auf nur 0,6 GB, sodass es mit Platz nach oben in 2 GB RAM passt. Damit läuft es praktisch überall: auf einem alten Laptop, einem Board der Raspberry-Pi-Klasse, einem Smartphone oder in einer Ecke jeder modernen GPU. Sieh es als das Modell, zu dem du greifst, wenn du lokale Textgenerierung auf Hardware willst, die eigentlich gar kein LLM betreiben sollte – nicht als Alleskönner-Assistent.

Im täglichen Einsatz ist das herausragende Merkmal die schiere Geschwindigkeit. Auf einer RTX 3060 erreicht es etwa 841 tok/s, ein M-Series Max liegt bei rund 958, und eine 4090 schafft ungefähr 2355 tok/s – weit schneller, als du lesen kannst, und schnell genug für enge Schleifen oder Batch-Jobs. Selbst auf einer CPU mit DDR5 bekommst du etwa 140 tok/s, völlig brauchbar. Das 32K-Kontextfenster ist echt, und weil das Ganze klein bleibt, braucht ein voll ausgelasteter 32K-Kontext insgesamt nur rund 1,7 GB – Druck durch den KV-Cache ist hier also selten ein Thema.

Sei ehrlich zu dir selbst beim Kompromiss: Mit 0,6B Parametern ist es ein Chat-Modell, kein Reasoner. Für alles Mehrschrittige, Strukturierte oder Code-lastige zieht Qwen 3 4B aus derselben Familie meist deutlich davon, und selbst Qwen 3 1.7B folgt Anweisungen in der Regel zuverlässiger. Gegen Gemma 3 1B ist es die leichtere, schnellere Wahl, auch wenn beide bei einfachem Chat in ähnlichem Terrain liegen. Sein echter Vorteil ist der geringe Speicherbedarf plus Tempo, und die Lizenz hilft: Apache 2.0 bedeutet, dass du es frei nutzen kannst, auch kommerziell, ohne anbieterspezifische Auflagen.

Technische Daten

Parameter0.6B
Kontextfenster32K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.350.3 GB2 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.850.4 GB2 GBEmpfohlen
Q5_K_M5.650.4 GB2 GBHoch
Q8_08.50.6 GB3 GBNahezu Original
F16161.2 GB3 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.2 GB~0.6 GB
8K Token~0.3 GB~0.7 GB
32K Token~1.3 GB~1.7 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~841 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~2355 tok/s
Apple M-series (base)100 GB/s~234 tok/s
Apple M-series Pro270 GB/s~631 tok/s
Apple M-series Max410 GB/s~958 tok/s
CPU only (dual-channel DDR5)60 GB/s~140 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:0.6b

Häufig gestellte Fragen

Qwen 3 0.6B Systemanforderungen — Kann ich es lokal ausführen?