← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 8B lokal ausführen?

Qwen 3 8B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (5.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~62 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Zu Qwen 3 8B greifst du, wenn du einen lokalen Assistenten willst, der wirklich ein wenig denken kann und nicht nur plaudert. In 4-Bit liegt es bei rund 5 GB, passt also auf eine 8-GB-GPU, und der Mindestwert von 8 GB RAM bedeutet, dass ein einfacher Apple-Silicon-Mac oder ein bescheidener Desktop es problemlos betreiben kann. Das herausragende Merkmal ist der hybride Denkmodus: Das Modell kann zusätzliche Tokens aufwenden, um ein Problem vor der Antwort durchzudenken. Genau deshalb wählen Leute es gegenüber reinen Chat-Modellen derselben 8B-Klasse.

Im Alltag fühlt es sich flott an. Auf einer RTX 3060 12GB bekommst du etwa 62 Tokens pro Sekunde, auf einem M-series Max rund 70, und eine RTX 4090 treibt es auf etwa 172 tok/s, allesamt schnell genug, dass die Antworten deinem Lesetempo davonlaufen. Nur auf der CPU mit DDR5 fällt es auf etwa 10 tok/s, in Ordnung für Batch-Arbeit, aber nicht interaktiv. Der 128K-Kontext ist echt, aber Vorsicht: Füllst du ihn komplett, steigt der Gesamtspeicher auf etwa 22 GB, weit über das, was eine 8-GB-Karte fasst. Halte den genutzten Kontext also moderat, sofern du keinen Spielraum hast oder auf das 3.4 GB große q2-Build ausweichst.

Gegenüber Granite 3.3 8B, einem offenen Modell ähnlicher Größe, das vor allem auf Chat ausgelegt ist, hat Qwen 3 8B beim mehrstufigen Schlussfolgern und in Mathematik dank seines Denkmodus meist die Nase vorn, während sich Granite eher gesprächiger anfühlt. Sein herausragendes Merkmal ist dieser Reasoning-Schalter in einem so kleinen Paket. Und die Lizenz ist der einfache Teil: Apache 2.0 heißt, du darfst es kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen, was bei dieser Größe seltener ist, als es sein sollte.

Technische Daten

Parameter8.2B
Kontextfenster128K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.353.4 GB6 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.855.0 GB8 GBEmpfohlen
Q5_K_M5.655.8 GB12 GBHoch
Q8_08.58.7 GB16 GBNahezu Original
F161616.4 GB24 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.5 GB~5.5 GB
8K Token~1.1 GB~6.1 GB
32K Token~4.2 GB~9.2 GB
128K Token~17.0 GB~22.0 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~62 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~172 tok/s
Apple M-series (base)100 GB/s~17 tok/s
Apple M-series Pro270 GB/s~46 tok/s
Apple M-series Max410 GB/s~70 tok/s
CPU only (dual-channel DDR5)60 GB/s~10 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3

Häufig gestellte Fragen

Qwen 3 8B Systemanforderungen — Kann ich es lokal ausführen?