Kann ich Qwen 3.5 35B-A3B lokal ausführen?
Qwen 3.5 35B-A3B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (21.2 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~192 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3.5 35B-A3B ist ein Mixture-of-Experts-Modell mit einem cleveren Kniff im Kern: Von seinen 35B Parametern sind pro Token nur rund 3B aktiv. Es generiert also mit dem Tempo eines winzigen Modells, schöpft aber aus dem Wissen eines großen. Der Haken ist der Speicher. Du hältst trotzdem das komplette Modell im RAM, also plane mit dem vollen Footprint, nicht mit dem aktiven Anteil. In 4-Bit landet es bei etwa 21 GB, und du willst mindestens 32 GB Arbeitsspeicher. Eine RTX 3060 mit 12 GB reicht nicht, realistisch brauchst du also eine 24-GB-GPU oder einen Apple-Silicon-Rechner mit viel Speicher.
Sobald es passt, zahlt sich das MoE-Design aus und das Modell fühlt sich flott an für seine Gewichtsklasse. Auf einer RTX 4090 sind rund 471 Tokens pro Sekunde drin, auf einem Apple M Max etwa 192 – beides schnell genug, dass die Antwort schneller kommt, als du lesen kannst. Eine CPU auf DDR5 schafft etwa 28 Tokens pro Sekunde, langsam, aber für Batch-Verarbeitung brauchbar. Es beherrscht Chat, Reasoning, Coding und Vision, mit einem großzügigen Kontextfenster von 256K. Geh mit dieser Obergrenze aber bewusst um: Bei 128K Kontext klettert der Gesamtspeicherbedarf auf rund 53,8 GB, lange Kontext-Sessions brauchen also wirklich eine große Maschine, nicht nur genug, um die Gewichte zu laden.
Gegen Command R 35B, ein gleich großes Dense-Modell, das sich zum Vergleich anbietet, liegt der echte Unterschied in der MoE-Architektur statt in der Parameterzahl: gleiche nominale Größe, aber Qwen läuft pro Token meist deutlich schneller, weil nur 3B aktiv sind. Dieses Verhältnis von Tempo zu Leistung ist sein herausstechendes Merkmal – nahezu sofortige Generierung aus einem Modell mit dem Wissen von 35B, dazu die multimodale Vision-Unterstützung. Die kleineren Qwen 3 0.6B und 1.7B sind die richtige Wahl, wenn du speicherbeschränkt bist und nur einfachen Chat brauchst. Die Lizenz ist der einfache Teil: Apache 2.0 heißt, du kannst es frei nutzen, auch kommerziell und in Produktion, ohne anbieterspezifische Klauseln zum Nachlesen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 21.2 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Hoch |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Nahezu Original |
| F16 | 16 | 70.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~22.2 GB |
| 8K Token | ~2.0 GB | ~23.2 GB |
| 32K Token | ~8.1 GB | ~29.3 GB |
| 128K Token | ~32.6 GB | ~53.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3.5:35bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai