Kann ich Qwen 3 32B lokal ausführen?
Qwen 3 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~18 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3 32B ist das Modell, zu dem man greift, wenn ein 8B-Modell an den kniffligen Stellen immer wieder strauchelt und genug Speicher vorhanden ist. Es handelt sich um ein dichtes Modell mit 32,8 Mrd. Parametern, gebaut für Chat und Reasoning, das in 4-Bit-Quantisierung rund 19,9 GB wiegt. Damit liegt es außer Reichweite für eine 12-GB-Karte wie die RTX 3060, auf der es schlicht nicht passt, und es verlangt mindestens 32 GB Arbeitsspeicher. Realistische Plätze dafür sind eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Das ist kein Modell für unterwegs auf dem Laptop, sondern ein Workstation-Modell.
Im Alltag wirkt es bedächtig statt flott. Auf einer RTX 4090 kannst du in 4-Bit mit etwa 43 tok/s rechnen, bequem schneller als Lesetempo, während sich ein M-Max eher bei 18 tok/s einpendelt und reine CPU auf DDR5 mit rund 3 tok/s dahinkriecht, brauchbar für Batch-Jobs, aber quälend für Live-Chat. Die 128K-Kontextlänge ist für lange Reasoning-Ketten wirklich nützlich, aber behandle sie mit Respekt: Sie voll auszunutzen treibt den Gesamtspeicher auf etwa 51,6 GB, was über eine einzelne 24-GB-Karte hinausgeht. Halte den Arbeitskontext maßvoll, sofern du nicht den Spielraum hast, ihn abzudecken.
Gegenüber der anderen 32B-Reasoning-Option, DeepSeek R1 32B, geht es vor allem um die Wesensart: R1 neigt stärker zur expliziten Chain-of-Thought, während sich Qwen 3 32B insgesamt ausgewogener anfühlt, als Allzweck-Assistent, der bei Bedarf trotzdem reasonen kann. Sein herausragendes Merkmal ist diese Kombination aus breiter Leistungsfähigkeit und einer sauberen Apache-2.0-Lizenz, sodass du es kommerziell und in Produktion ohne rechtliche Reibung einsetzen kannst. Wenn du den kleineren Qwen-3-Chatmodellen 0.6B und 1.7B entwachsen bist und echtes Reasoning-Gewicht willst, das dir voll gehört, ist dies der Schritt nach oben, vorausgesetzt deine Hardware kann es tragen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 19.9 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Nahezu Original |
| F16 | 16 | 65.6 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~20.9 GB |
| 8K Token | ~2.0 GB | ~21.9 GB |
| 32K Token | ~7.9 GB | ~27.8 GB |
| 128K Token | ~31.7 GB | ~51.6 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3:32bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai