Kann ich Qwen 3 0.6B lokal ausführen?
Qwen 3 0.6B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 2 GB RAM (0.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~841 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3 0.6B ist ein wirklich winziges Modell, und genau das ist der Sinn. In 4-Bit belegt es rund 0,4 GB, und selbst ein q8-Build kommt auf nur 0,6 GB, sodass es mit Platz nach oben in 2 GB RAM passt. Damit läuft es praktisch überall: auf einem alten Laptop, einem Board der Raspberry-Pi-Klasse, einem Smartphone oder in einer Ecke jeder modernen GPU. Sieh es als das Modell, zu dem du greifst, wenn du lokale Textgenerierung auf Hardware willst, die eigentlich gar kein LLM betreiben sollte – nicht als Alleskönner-Assistent.
Im täglichen Einsatz ist das herausragende Merkmal die schiere Geschwindigkeit. Auf einer RTX 3060 erreicht es etwa 841 tok/s, ein M-Series Max liegt bei rund 958, und eine 4090 schafft ungefähr 2355 tok/s – weit schneller, als du lesen kannst, und schnell genug für enge Schleifen oder Batch-Jobs. Selbst auf einer CPU mit DDR5 bekommst du etwa 140 tok/s, völlig brauchbar. Das 32K-Kontextfenster ist echt, und weil das Ganze klein bleibt, braucht ein voll ausgelasteter 32K-Kontext insgesamt nur rund 1,7 GB – Druck durch den KV-Cache ist hier also selten ein Thema.
Sei ehrlich zu dir selbst beim Kompromiss: Mit 0,6B Parametern ist es ein Chat-Modell, kein Reasoner. Für alles Mehrschrittige, Strukturierte oder Code-lastige zieht Qwen 3 4B aus derselben Familie meist deutlich davon, und selbst Qwen 3 1.7B folgt Anweisungen in der Regel zuverlässiger. Gegen Gemma 3 1B ist es die leichtere, schnellere Wahl, auch wenn beide bei einfachem Chat in ähnlichem Terrain liegen. Sein echter Vorteil ist der geringe Speicherbedarf plus Tempo, und die Lizenz hilft: Apache 2.0 bedeutet, dass du es frei nutzen kannst, auch kommerziell, ohne anbieterspezifische Auflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.3 GB | 2 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 0.4 GB | 2 GB | Empfohlen |
| Q5_K_M | 5.65 | 0.4 GB | 2 GB | Hoch |
| Q8_0 | 8.5 | 0.6 GB | 3 GB | Nahezu Original |
| F16 | 16 | 1.2 GB | 3 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.2 GB | ~0.6 GB |
| 8K Token | ~0.3 GB | ~0.7 GB |
| 32K Token | ~1.3 GB | ~1.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~841 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~2355 tok/s |
| Apple M-series (base) | 100 GB/s | ~234 tok/s |
| Apple M-series Pro | 270 GB/s | ~631 tok/s |
| Apple M-series Max | 410 GB/s | ~958 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~140 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3:0.6bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai