← Alle ModelleMODELL-CHECK

Kann ich Qwen 3.5 35B-A3B lokal ausführen?

Qwen 3.5 35B-A3B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (21.2 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~192 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3.5 35B-A3B ist ein Mixture-of-Experts-Modell mit einem cleveren Kniff im Kern: Von seinen 35B Parametern sind pro Token nur rund 3B aktiv. Es generiert also mit dem Tempo eines winzigen Modells, schöpft aber aus dem Wissen eines großen. Der Haken ist der Speicher. Du hältst trotzdem das komplette Modell im RAM, also plane mit dem vollen Footprint, nicht mit dem aktiven Anteil. In 4-Bit landet es bei etwa 21 GB, und du willst mindestens 32 GB Arbeitsspeicher. Eine RTX 3060 mit 12 GB reicht nicht, realistisch brauchst du also eine 24-GB-GPU oder einen Apple-Silicon-Rechner mit viel Speicher.

Sobald es passt, zahlt sich das MoE-Design aus und das Modell fühlt sich flott an für seine Gewichtsklasse. Auf einer RTX 4090 sind rund 471 Tokens pro Sekunde drin, auf einem Apple M Max etwa 192 – beides schnell genug, dass die Antwort schneller kommt, als du lesen kannst. Eine CPU auf DDR5 schafft etwa 28 Tokens pro Sekunde, langsam, aber für Batch-Verarbeitung brauchbar. Es beherrscht Chat, Reasoning, Coding und Vision, mit einem großzügigen Kontextfenster von 256K. Geh mit dieser Obergrenze aber bewusst um: Bei 128K Kontext klettert der Gesamtspeicherbedarf auf rund 53,8 GB, lange Kontext-Sessions brauchen also wirklich eine große Maschine, nicht nur genug, um die Gewichte zu laden.

Gegen Command R 35B, ein gleich großes Dense-Modell, das sich zum Vergleich anbietet, liegt der echte Unterschied in der MoE-Architektur statt in der Parameterzahl: gleiche nominale Größe, aber Qwen läuft pro Token meist deutlich schneller, weil nur 3B aktiv sind. Dieses Verhältnis von Tempo zu Leistung ist sein herausstechendes Merkmal – nahezu sofortige Generierung aus einem Modell mit dem Wissen von 35B, dazu die multimodale Vision-Unterstützung. Die kleineren Qwen 3 0.6B und 1.7B sind die richtige Wahl, wenn du speicherbeschränkt bist und nur einfachen Chat brauchst. Die Lizenz ist der einfache Teil: Apache 2.0 heißt, du kannst es frei nutzen, auch kommerziell und in Produktion, ohne anbieterspezifische Klauseln zum Nachlesen.

Technische Daten

Parameter35B (3B aktiv)
Kontextfenster256K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2026-02
Am besten fürChat, Logisches Denken, Programmieren, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3514.7 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8521.2 GB32 GBEmpfohlen
Q5_K_M5.6524.7 GB48 GBHoch
Q8_08.537.2 GB48 GBNahezu Original
F161670.0 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~22.2 GB
8K Token~2.0 GB~23.2 GB
32K Token~8.1 GB~29.3 GB
128K Token~32.6 GB~53.8 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3.5:35b

Häufig gestellte Fragen

Qwen 3.5 35B-A3B Systemanforderungen — Kann ich es lokal ausführen?