Kann ich Qwen 3.5 122B-A10B lokal ausführen?
Qwen 3.5 122B-A10B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (74.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~57 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3.5 122B-A10B ist ein großes Mixture-of-Experts-Modell für alle, die Chat, Reasoning, Coding und Vision auf Frontier-Niveau auf eigener Hardware betreiben wollen. Der MoE-Aufbau ist der entscheidende Punkt: Von den insgesamt 122B Parametern sind pro Token nur 10B aktiv, weshalb das Modell deutlich schneller generiert als ein gleich großes dichtes Modell. Der Haken ist der Speicher, denn das vollständige Modell muss trotzdem komplett im Speicher liegen. Bei 4-Bit-Quantisierung sind das rund 74 GB, und zum bloßen Laden brauchst du etwa 96 GB RAM. In der Praxis heißt das: eine Workstation mit viel Speicher oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Auf eine RTX 4090 mit 24 GB passt es nicht, geschweige denn auf eine 12-GB-Karte.
Wo es passt, wirkt es für seine Größe überraschend flott – dank der 10B aktiven Parameter. Auf einem M Max kannst du mit rund 57 tok/s rechnen, schnell genug, um den Stream bequem mitzulesen, während eine reine CPU-Maschine mit DDR5 auf etwa 8 tok/s fällt und sich eher für Batch-Verarbeitung als für Live-Chat eignet. Das Kontextfenster reicht bis 256K, aber betrachte das als Obergrenze. Der Speicherbedarf wächst mit dem, was du tatsächlich füllst, und bei 128K Kontext steigt der Gesamtbedarf auf etwa 131 GB – die Long-Context-Werte setzen also eine dafür ausgelegte Maschine voraus.
Im Vergleich zu Devstral 2 123B, das bei nahezu identischer Parameterzahl liegt, tauscht Qwen 3.5 den reinen Coding-Fokus meist gegen Breite ein: Es deckt Chat, Reasoning und Vision in einem einzigen Modell ab, statt sich zu spezialisieren. Genau diese Vielseitigkeit ist seine Stärke, während die kleineren Geschwister Qwen 3 0.6B und 1.7B die vernünftige Wahl bleiben, wenn du nur leichtgewichtigen Chat auf bescheidener Hardware brauchst. Die Lizenz ist Apache 2.0, du darfst es also uneingeschränkt kommerziell und in Produktion einsetzen – das ist auf diesem Leistungsniveau selten und ein echtes Argument gegenüber stärker eingeschränkten Gewichten.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 51.1 GB | 96 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 74.0 GB | 96 GB | Empfohlen |
| Q5_K_M | 5.65 | 86.2 GB | 128 GB | Hoch |
| Q8_0 | 8.5 | 129.6 GB | 192 GB | Nahezu Original |
| F16 | 16 | 244.0 GB | 256 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.8 GB | ~75.8 GB |
| 8K Token | ~3.6 GB | ~77.6 GB |
| 32K Token | ~14.3 GB | ~88.3 GB |
| 128K Token | ~57.2 GB | ~131.2 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~14 tok/s |
| Apple M-series Pro | 270 GB/s | ~38 tok/s |
| Apple M-series Max | 410 GB/s | ~57 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~8 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3.5:122bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai