Kann ich Qwen 3.6 27B lokal ausführen?
Qwen 3.6 27B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (16.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~21 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3.6 27B ist Alibabas mittelgroßes Arbeitstier für alle, die ein einziges leistungsfähiges lokales Modell wollen, das Chat, Reasoning, Coding und Bilder abdeckt, ohne in die Cloud zu greifen. Es ist ein dichtes 27B-Modell, also läuft jeder Parameter bei jedem Token mit, und das schlägt sich im Speicherbedarf nieder: Eine 4-Bit-Quantisierung liegt bei rund 16.4 GB, und du brauchst etwa 24 GB RAM, um es überhaupt zu laden. Damit ist es für eine 12-GB-Karte wie die RTX 3060 außer Reichweite, dort passt es schlicht nicht hinein, und es bewegt sich klar im Bereich einer 24-GB-RTX-4090 oder eines Apple-Silicon-Macs mit mehr Speicher.
Auf einer 4090 kannst du bei 4-Bit mit grob 52 Tokens pro Sekunde rechnen, was schneller streamt als du liest und sich für einen interaktiven Assistenten wirklich reaktionsschnell anfühlt. Auf einem M-Series Max pendelt es sich bei rund 21 tok/s ein, immer noch angenehm für Chat und Coding. Das 256K-Kontextfenster ist die Schlagzeile, aber behandle es als Obergrenze, nicht als Standard. Der Speicher steigt steil, je weiter du es füllst: Bei 128K Kontext liegt der gesamte Arbeitsspeicherbedarf bei etwa 45.4 GB. Solange du also kein Workstation-Setup hast, halte den Alltagskontext bescheiden und reserviere das lange Fenster für die seltene Aufgabe, die es wirklich braucht.
Gegen Gemma 3 27B, die andere naheliegende 27B-Option, nehmen sich die beiden gegenseitig nichts: Gemma 3 deckt Chat und Vision ab, während Qwen 3.6 27B auf derselben vision-fähigen Basis in der Regel stärkeres Coding und Reasoning ergänzt, was es zur breiteren Wahl macht, wenn du ein Modell für alles willst. Wenn dein Speicher knapp ist, ist das deutlich kleinere Qwen 3 1.7B der realistische Rückfall, allerdings rein auf Chat beschränkt, ohne Reasoning und ohne Bildverständnis. Die herausragende Eigenschaft von Qwen 3.6 27B ist die Breite in einem einzigen dichten Modell, und es kommt unter Apache 2.0, du kannst es also kommerziell und in Produktion einsetzen, ohne Lizenzsorgen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.3 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 16.4 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 19.1 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 28.7 GB | 48 GB | Nahezu Original |
| F16 | 16 | 54.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~17.3 GB |
| 8K Token | ~1.8 GB | ~18.2 GB |
| 32K Token | ~7.3 GB | ~23.7 GB |
| 128K Token | ~29.0 GB | ~45.4 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3.6:27bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai