Kann ich Qwen3-VL 8B lokal ausführen?
Qwen3-VL 8B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~63 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen3-VL 8B ist Alibabas bildfähiges Modell in der 8B-Klasse und damit die erste Wahl, wenn du einen lokalen Assistenten willst, der Bilder und Screenshots wirklich ansehen kann und nicht nur Text liest. Mit 4-Bit-Quantisierung landet es bei rund 4,9 GB, passt also mit Reserve auf eine 12-GB-Karte wie eine RTX 3060 und liegt auf jedem Apple-Silicon-Mac bequem im Unified Memory. Der sinnvolle Mindestbedarf liegt bei etwa 8 GB RAM; wenn es eng wird, kannst du auf einen 2-Bit-Build mit ungefähr 3,4 GB ausweichen, während das schwerere q8 bei knapp 8,5 GB liegt.
Im täglichen Einsatz fühlt es sich für ein 8B-Modell flott an. Auf einer RTX 3060 sind bei 4-Bit rund 63 tok/s zu erwarten, ein M-Max schiebt das auf etwa 72 – beides schnell genug, dass die Antworten zügiger streamen, als du lesen kannst; eine 4090 zieht mit rund 177 tok/s davon. Die Schlagzeile ist das 256K-Kontextfenster, doch behandle es als Obergrenze, nicht als Standard. Bei 128K Kontext brauchen Modell plus KV-Cache bereits rund 21,7 GB insgesamt – deutlich mehr, als eine einzelne Mittelklasse-Karte fasst. Halte den Arbeitskontext also moderat, sofern du keine große GPU hast.
Gegenüber Llama 3.1 8B, dem naheliegenden Vergleich derselben Größe, ist Qwen3-VLs Stärke genau das, was Llama schlicht nicht kann: Es liest Bilder. Bei reinem Text-Chat liegen beide nah genug beieinander, dass die Wahl darauf hinausläuft, ob du Vision brauchst. Fütterst du es nur mit Text, hat Llama weiterhin das ausgereiftere Tooling-Ökosystem; willst du Screenshots beschreiben oder Text aus einem Foto lokal extrahieren, ist dies das bessere Werkzeug. Es wird unter Apache 2.0 ausgeliefert, du kannst es also kommerziell und im Produktivbetrieb ohne Lizenzsorgen einsetzen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.9 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Nahezu Original |
| F16 | 16 | 16.0 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.4 GB |
| 8K Token | ~1.0 GB | ~5.9 GB |
| 32K Token | ~4.2 GB | ~9.1 GB |
| 128K Token | ~16.8 GB | ~21.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3-vl:8bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai