Kann ich Qwen 3.6 35B-A3B lokal ausführen?
Qwen 3.6 35B-A3B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (21.2 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~192 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3.6 35B-A3B ist ein Mixture-of-Experts-Modell, und genau das beschreibt, für wen es gedacht ist. Es bringt 35B Parameter insgesamt mit, aktiviert pro Token aber nur 3B – es läuft also mit dem Tempo eines winzigen Modells, braucht aber den Speicher eines großen. Bei 4-Bit-Quantisierung liegen die Gewichte bei rund 21.2 GB, dennoch benötigt das Modell mindestens etwa 32 GB RAM, um alle Experten vorzuhalten. Damit fällt eine 12-GB-Karte wie die RTX 3060 raus – dort passt es schlicht nicht. Das natürliche Zuhause sind eine 24-GB-RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory.
Im Alltag zahlt sich die Rechnung mit nur 3B aktiven Parametern aus: Auf einer 4090 sind rund 471 Tokens pro Sekunde drin, auf einem M-Max etwa 192 – schneller als die meisten dichten Modelle mit einem Drittel dieser Größe. Selbst die CPU-Inferenz auf DDR5 schafft noch etwa 28 tok/s, brauchbar für Batch-Aufgaben. Es deckt Chat, Reasoning, Coding und Vision ab und rechtfertigt damit seinen Platz als einziges lokales Allround-Modell. Das 256K-Kontextfenster ist großzügig, doch der Speicher ist der Haken: Schon 128K zu füllen treibt den Gesamtbedarf auf rund 53.8 GB – Long-Context-Arbeit will also eine 64-GB-Maschine, keine 24-GB-Karte.
Gegenüber dem dichten Command R 35B aus der verwandten Reihe wirkt dieses MoE bei gleicher nomineller Größe in der Regel deutlich schneller, denn du zahlst zwar für 35B an Speicher, rechnest aber wie mit 3B. Der Kompromiss ist der typische MoE-Handel: Ein dichtes 35B kann beim schwierigsten Single-Shot-Reasoning manchmal die Nase vorn haben, doch für die meiste Arbeit gewinnt das Tempo. Seine Stärke ist genau dieses Verhältnis von Geschwindigkeit zu Fähigkeit, kombiniert mit nativer Vision in einem Paket. Die Lizenz ist Apache 2.0 – du darfst es also frei kommerziell und in Produktion einsetzen, ohne Auflagen seitens des Anbieters.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 21.2 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Hoch |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Nahezu Original |
| F16 | 16 | 70.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~22.2 GB |
| 8K Token | ~2.0 GB | ~23.2 GB |
| 32K Token | ~8.1 GB | ~29.3 GB |
| 128K Token | ~32.6 GB | ~53.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3.6:35bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai