← Alle ModelleMODELL-CHECK

Kann ich Qwen3-VL 32B lokal ausführen?

Qwen3-VL 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (20.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~17 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen3-VL 32B ist Alibabas Modell für Vision und Reasoning – gedacht für alle, die einen lokalen Assistenten wollen, der Bilder wirklich ansehen kann und nicht nur Text liest. Mit 33B dichten Parametern ist es ein deutlich größerer Brocken als die üblichen 7-8B-Einsteigermodelle: Ein 4-Bit-Quant liegt bei rund 20 GB, und du brauchst mindestens 32 GB System-RAM, um das vollständige Modell bequem zu laden. Eine 12-GB-Karte wie die RTX 3060 fällt damit raus – dort passt es schlicht nicht hinein. Realistisch ist das eine 24-GB-GPU oder eine gut ausgestattete Apple-Silicon-Maschine, kein Modell für den x-beliebigen Laptop.

Im Alltag wirkt es leistungsfähig, aber eher bedächtig als flott. Auf einer RTX 4090 kannst du bei 4-Bit mit rund 43 Tokens pro Sekunde rechnen – schnell genug für angenehmen Chat und Bildfragen; auf einem M-Max-Mac sind es eher 17 Tokens pro Sekunde, nutzbar, aber langsamer, als man sich für längere Sitzungen wünscht, und reines CPU-Inferenz mit etwa 3 Tokens pro Sekunde ist nur die Notlösung. Das Kontextfenster von 256K ist großzügig, doch der Speicher wächst rasant mit: Schon bei 128K klettert der Gesamtbedarf auf etwa 51,7 GB – plane also lieber mit moderatem Arbeitskontext, sofern du nicht reichlich Spielraum hast.

Gegenüber EXAONE 4.5 33B, dem naheliegenden gleich großen Rivalen, der ebenfalls Vision und Reasoning beherrscht, nehmen sich beide nicht viel – die Wahl hängt am Tooling und daran, welchem Ökosystem du ohnehin schon vertraust. Qwen3-VLs Stärke ist eine ausgereifte, breit unterstützte Familie mit einem einfachen Ollama-Pull über qwen3-vl:32b. Sein herausragendes Merkmal ist wirklich starkes multimodales Reasoning bei einer Größe, die du noch auf einer einzigen GPU selbst hosten kannst. Und die Lizenz ist der einfache Teil: Apache 2.0 bedeutet, dass du es frei nutzen darfst – auch kommerziell und im Produktivbetrieb, ohne anbieterspezifische Auflagen.

Technische Daten

Parameter33B
Kontextfenster256K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-10
Am besten fürBilderkennung, Chat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3513.8 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8520.0 GB32 GBEmpfohlen
Q5_K_M5.6523.3 GB32 GBHoch
Q8_08.535.1 GB48 GBNahezu Original
F161666.0 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~21.0 GB
8K Token~2.0 GB~22.0 GB
32K Token~7.9 GB~27.9 GB
128K Token~31.7 GB~51.7 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~11 tok/s
Apple M-series Max410 GB/s~17 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3-vl:32b

Häufig gestellte Fragen

Qwen3-VL 32B Systemanforderungen — Kann ich es lokal ausführen?