Kann ich QwQ 32B lokal ausführen?
QwQ 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~18 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
QwQ 32B ist Alibabas Reasoning-Spezialist, kein allgemeines Chat-Modell – und genau diese Einordnung sollte man kennen, bevor man etwas herunterlädt. Es ist ein dichtes Modell mit 32,8 Mrd. Parametern, das vor der Antwort in langen Gedankenketten laut mitdenkt. Das macht es stark bei Mathe und mehrstufigen Aufgaben, aber langsam und geschwätzig bei kurzen Fragen. In 4-Bit-Quantisierung landet es bei rund 19,9 GB, also passt es schlicht nicht in die 12 GB der RTX 3060. Realistisch brauchst du 32 GB System- oder Unified-Memory, um es überhaupt zu betreiben – das bedeutet Workstation, 24-GB-GPU oder höherwertiges Apple Silicon statt einer typischen Gaming-Karte.
Im Alltag wirkt es bedacht statt flott. Auf einer RTX 4090 kannst du in 4-Bit mit etwa 43 Tokens pro Sekunde rechnen – das klingt ordentlich, bis man bedenkt, dass dieses Modell die meisten dieser Tokens für das Reasoning verbraucht, bevor es zur Antwort kommt. Ein einzelner schwieriger Prompt kann also eine Weile laufen. Auf einem Apple M Max sinkt es auf rund 18 Tokens pro Sekunde, und auf einer DDR5-CPU kriecht es bei knapp 3 Tokens pro Sekunde. Die 128K Kontext sind echt, doch wenn du sie ausreizt, treibt das den Gesamtspeicher auf etwa 51,6 GB – deutlich über der 32-GB-Untergrenze. Halte den Arbeitskontext also moderat, sofern du keinen Spielraum hast.
Gegenüber DeepSeek R1 32B, dem anderen dichten 32B-Reasoner hier, liegen beide bei Speicherbedarf und Ausrichtung nah beieinander, und welches gewinnt, hängt eher von der konkreten Aufgabe ab als von einem klaren Vorsprung – ein Vergleich beider lohnt sich. Wenn du nur ein paar Gigabyte hast, sind die winzigen Chat-Modelle Qwen 3 0.6B oder 1.7B ein völlig anderes Werkzeug: gut für schnelle Antworten, aber nicht für das tiefe Reasoning, für das QwQ gebaut ist. QwQs herausragende Stärke ist Reasoning auf Frontier-Niveau, Schritt für Schritt, in einer Größe, die du selbst hosten kannst – und da es unter Apache 2.0 steht, ist es ohne Lizenzauflagen frei kommerziell nutzbar.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 19.9 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Nahezu Original |
| F16 | 16 | 65.6 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~20.9 GB |
| 8K Token | ~2.0 GB | ~21.9 GB |
| 32K Token | ~7.9 GB | ~27.8 GB |
| 128K Token | ~31.7 GB | ~51.6 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwq