← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 32B lokal ausführen?

Qwen 3 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~18 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 32B ist das Modell, zu dem man greift, wenn ein 8B-Modell an den kniffligen Stellen immer wieder strauchelt und genug Speicher vorhanden ist. Es handelt sich um ein dichtes Modell mit 32,8 Mrd. Parametern, gebaut für Chat und Reasoning, das in 4-Bit-Quantisierung rund 19,9 GB wiegt. Damit liegt es außer Reichweite für eine 12-GB-Karte wie die RTX 3060, auf der es schlicht nicht passt, und es verlangt mindestens 32 GB Arbeitsspeicher. Realistische Plätze dafür sind eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Das ist kein Modell für unterwegs auf dem Laptop, sondern ein Workstation-Modell.

Im Alltag wirkt es bedächtig statt flott. Auf einer RTX 4090 kannst du in 4-Bit mit etwa 43 tok/s rechnen, bequem schneller als Lesetempo, während sich ein M-Max eher bei 18 tok/s einpendelt und reine CPU auf DDR5 mit rund 3 tok/s dahinkriecht, brauchbar für Batch-Jobs, aber quälend für Live-Chat. Die 128K-Kontextlänge ist für lange Reasoning-Ketten wirklich nützlich, aber behandle sie mit Respekt: Sie voll auszunutzen treibt den Gesamtspeicher auf etwa 51,6 GB, was über eine einzelne 24-GB-Karte hinausgeht. Halte den Arbeitskontext maßvoll, sofern du nicht den Spielraum hast, ihn abzudecken.

Gegenüber der anderen 32B-Reasoning-Option, DeepSeek R1 32B, geht es vor allem um die Wesensart: R1 neigt stärker zur expliziten Chain-of-Thought, während sich Qwen 3 32B insgesamt ausgewogener anfühlt, als Allzweck-Assistent, der bei Bedarf trotzdem reasonen kann. Sein herausragendes Merkmal ist diese Kombination aus breiter Leistungsfähigkeit und einer sauberen Apache-2.0-Lizenz, sodass du es kommerziell und in Produktion ohne rechtliche Reibung einsetzen kannst. Wenn du den kleineren Qwen-3-Chatmodellen 0.6B und 1.7B entwachsen bist und echtes Reasoning-Gewicht willst, das dir voll gehört, ist dies der Schritt nach oben, vorausgesetzt deine Hardware kann es tragen.

Technische Daten

Parameter32.8B
Kontextfenster128K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3513.7 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8519.9 GB32 GBEmpfohlen
Q5_K_M5.6523.2 GB32 GBHoch
Q8_08.534.8 GB48 GBNahezu Original
F161665.6 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~20.9 GB
8K Token~2.0 GB~21.9 GB
32K Token~7.9 GB~27.8 GB
128K Token~31.7 GB~51.6 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:32b

Häufig gestellte Fragen

Qwen 3 32B Systemanforderungen — Kann ich es lokal ausführen?