Kann ich Qwen 3 8B lokal ausführen?
Qwen 3 8B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (5.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~62 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Zu Qwen 3 8B greifst du, wenn du einen lokalen Assistenten willst, der wirklich ein wenig denken kann und nicht nur plaudert. In 4-Bit liegt es bei rund 5 GB, passt also auf eine 8-GB-GPU, und der Mindestwert von 8 GB RAM bedeutet, dass ein einfacher Apple-Silicon-Mac oder ein bescheidener Desktop es problemlos betreiben kann. Das herausragende Merkmal ist der hybride Denkmodus: Das Modell kann zusätzliche Tokens aufwenden, um ein Problem vor der Antwort durchzudenken. Genau deshalb wählen Leute es gegenüber reinen Chat-Modellen derselben 8B-Klasse.
Im Alltag fühlt es sich flott an. Auf einer RTX 3060 12GB bekommst du etwa 62 Tokens pro Sekunde, auf einem M-series Max rund 70, und eine RTX 4090 treibt es auf etwa 172 tok/s, allesamt schnell genug, dass die Antworten deinem Lesetempo davonlaufen. Nur auf der CPU mit DDR5 fällt es auf etwa 10 tok/s, in Ordnung für Batch-Arbeit, aber nicht interaktiv. Der 128K-Kontext ist echt, aber Vorsicht: Füllst du ihn komplett, steigt der Gesamtspeicher auf etwa 22 GB, weit über das, was eine 8-GB-Karte fasst. Halte den genutzten Kontext also moderat, sofern du keinen Spielraum hast oder auf das 3.4 GB große q2-Build ausweichst.
Gegenüber Granite 3.3 8B, einem offenen Modell ähnlicher Größe, das vor allem auf Chat ausgelegt ist, hat Qwen 3 8B beim mehrstufigen Schlussfolgern und in Mathematik dank seines Denkmodus meist die Nase vorn, während sich Granite eher gesprächiger anfühlt. Sein herausragendes Merkmal ist dieser Reasoning-Schalter in einem so kleinen Paket. Und die Lizenz ist der einfache Teil: Apache 2.0 heißt, du darfst es kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen, was bei dieser Größe seltener ist, als es sein sollte.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 5.0 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.8 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.7 GB | 16 GB | Nahezu Original |
| F16 | 16 | 16.4 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.5 GB |
| 8K Token | ~1.1 GB | ~6.1 GB |
| 32K Token | ~4.2 GB | ~9.2 GB |
| 128K Token | ~17.0 GB | ~22.0 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~62 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~172 tok/s |
| Apple M-series (base) | 100 GB/s | ~17 tok/s |
| Apple M-series Pro | 270 GB/s | ~46 tok/s |
| Apple M-series Max | 410 GB/s | ~70 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~10 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3Quellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai