Kann ich GLM-4.6V-Flash lokal ausführen?
GLM-4.6V-Flash von Z.ai benötigt bei der empfohlenen 4-Bit-Quantisierung rund 12 GB RAM (5.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~56 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
GLM-4.6V-Flash ist ein 9B-Modell für Vision und Chat von Z.ai, gedacht für alle, die einen lokalen Assistenten wollen, der Bilder tatsächlich sehen und nicht nur Text lesen kann. Mit 4-Bit-Quantisierung belegt es etwa 5.5 GB und passt damit locker auf eine 12-GB-Karte wie die RTX 3060 sowie in den Unified Memory jedes halbwegs ordentlich ausgestatteten Apple-Silicon-Macs. Zum bequemen Laden solltest du mindestens rund 12 GB RAM einplanen. Wenn der Platz knapp ist, schrumpft ein 2-Bit-Build auf etwa 3.8 GB – das geht allerdings auf Kosten der Qualität.
Im Alltag fühlt es sich flott an. Auf einer RTX 3060 kannst du bei 4-Bit mit rund 56 tok/s rechnen, schnell genug, dass die Antworten zügiger als Lesetempo durchlaufen; eine 4090 treibt das auf etwa 157 tok/s, falls du eine hast. Ein M-Max liegt bei rund 64 tok/s, während reine CPU auf DDR5 mit etwa 9 tok/s dahinkriecht – nur etwas für Geduldige. Die 128K Kontext sind echt, aber teuer: Wird das Fenster voll gefüllt, steigt der Gesamtspeicher Richtung 23.2 GB, weit jenseits dessen, was eine 12-GB-Karte fasst. Halte den Arbeitskontext also moderat und setze eher auf Vision-Aufgaben als auf riesige Dokumente.
Im Vergleich zu seinen Geschwistern ist Qwen 2.5 VL 7B auf der Vision-Seite der naheliegende Maßstab und schlägt sich insgesamt gut, während Qwen 3.5 9B meist die stärkere Wahl ist, wenn du neben Bildern auch Reasoning brauchst. Die herausragende Eigenschaft von GLM-4.6V-Flash ist, dass es ein wirklich kompaktes multimodales Modell ist, das ohne großen Aufwand auf bescheidener Hardware läuft. Die Lizenz ist MIT, das heißt du darfst es ohne Auflagen des Anbieters kommerziell und produktiv einsetzen – ein echter Vorteil gegenüber vielen Open-Weight-Veröffentlichungen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.8 GB | 8 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 5.5 GB | 12 GB | Empfohlen |
| Q5_K_M | 5.65 | 6.4 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 9.6 GB | 16 GB | Nahezu Original |
| F16 | 16 | 18.0 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.6 GB | ~6.1 GB |
| 8K Token | ~1.1 GB | ~6.6 GB |
| 32K Token | ~4.4 GB | ~9.9 GB |
| 128K Token | ~17.7 GB | ~23.2 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~56 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~157 tok/s |
| Apple M-series (base) | 100 GB/s | ~16 tok/s |
| Apple M-series Pro | 270 GB/s | ~42 tok/s |
| Apple M-series Max | 410 GB/s | ~64 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~9 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.