Kann ich Qwen3-VL 32B lokal ausführen?
Qwen3-VL 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (20.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~17 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen3-VL 32B ist Alibabas Modell für Vision und Reasoning – gedacht für alle, die einen lokalen Assistenten wollen, der Bilder wirklich ansehen kann und nicht nur Text liest. Mit 33B dichten Parametern ist es ein deutlich größerer Brocken als die üblichen 7-8B-Einsteigermodelle: Ein 4-Bit-Quant liegt bei rund 20 GB, und du brauchst mindestens 32 GB System-RAM, um das vollständige Modell bequem zu laden. Eine 12-GB-Karte wie die RTX 3060 fällt damit raus – dort passt es schlicht nicht hinein. Realistisch ist das eine 24-GB-GPU oder eine gut ausgestattete Apple-Silicon-Maschine, kein Modell für den x-beliebigen Laptop.
Im Alltag wirkt es leistungsfähig, aber eher bedächtig als flott. Auf einer RTX 4090 kannst du bei 4-Bit mit rund 43 Tokens pro Sekunde rechnen – schnell genug für angenehmen Chat und Bildfragen; auf einem M-Max-Mac sind es eher 17 Tokens pro Sekunde, nutzbar, aber langsamer, als man sich für längere Sitzungen wünscht, und reines CPU-Inferenz mit etwa 3 Tokens pro Sekunde ist nur die Notlösung. Das Kontextfenster von 256K ist großzügig, doch der Speicher wächst rasant mit: Schon bei 128K klettert der Gesamtbedarf auf etwa 51,7 GB – plane also lieber mit moderatem Arbeitskontext, sofern du nicht reichlich Spielraum hast.
Gegenüber EXAONE 4.5 33B, dem naheliegenden gleich großen Rivalen, der ebenfalls Vision und Reasoning beherrscht, nehmen sich beide nicht viel – die Wahl hängt am Tooling und daran, welchem Ökosystem du ohnehin schon vertraust. Qwen3-VLs Stärke ist eine ausgereifte, breit unterstützte Familie mit einem einfachen Ollama-Pull über qwen3-vl:32b. Sein herausragendes Merkmal ist wirklich starkes multimodales Reasoning bei einer Größe, die du noch auf einer einzigen GPU selbst hosten kannst. Und die Lizenz ist der einfache Teil: Apache 2.0 bedeutet, dass du es frei nutzen darfst – auch kommerziell und im Produktivbetrieb, ohne anbieterspezifische Auflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.8 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 20.0 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 23.3 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 35.1 GB | 48 GB | Nahezu Original |
| F16 | 16 | 66.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~21.0 GB |
| 8K Token | ~2.0 GB | ~22.0 GB |
| 32K Token | ~7.9 GB | ~27.9 GB |
| 128K Token | ~31.7 GB | ~51.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~17 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3-vl:32bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai