Kann ich Qwen 3.5 27B lokal ausführen?
Qwen 3.5 27B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (16.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~21 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3.5 27B ist das Modell, zu dem du greifst, wenn ein 8B zu dünn wirkt und du echte Hardware zur Verfügung hast. Es ist ein dichtes 27B, das Chat, Reasoning, Coding und Vision beherrscht und damit als lokales Arbeitspferd taugt statt als Assistent für nur eine Aufgabe. Der Haken ist der Speicherbedarf: in 4-Bit landet es bei rund 16,4 GB, und du brauchst mindestens 24 GB RAM, um es sauber zu laden. Das schließt eine 12-GB-Karte wie die RTX 3060 aus, auf der es schlicht nicht passt, und verweist dich auf eine 24-GB-GPU oder einen Apple-Silicon-Mac mit reichlich Unified Memory.
Auf einer RTX 4090 kannst du in 4-Bit mit rund 52 Tokens pro Sekunde rechnen, was schneller streamt, als du liest, und für interaktives Arbeiten angenehm bleibt. Auf einem M-Max pendelt es sich bei etwa 21 Tokens pro Sekunde ein, weiterhin gut für Chat und Coding, aber langsamer bei langen Generierungen; reine CPU auf DDR5 fällt auf grob 3 Tokens pro Sekunde, was klar Geduldssache ist. Die 256K Kontext sind die Schlagzeile, aber behandle sie als Obergrenze: bei 128K klettert der Gesamtspeicher auf etwa 45,4 GB, halte den Arbeitskontext auf einer 24-GB-Karte also deutlich unter dem Maximum.
Der naheliegende Vergleich ist Gemma 3 27B, das andere offene 27B mit Vision in dieser Größenklasse. Gemma ist tendenziell die sichere Wahl, wenn es dir vor allem um ausgefeilten Chat und Bildverständnis geht, während Qwen 3.5 27B im Allgemeinen bei Coding und strukturiertem Reasoning stärker auftritt, und genau dort liegt sein herausragender Wert für Entwickler. Der große praktische Pluspunkt ist die Lizenz: es kommt unter Apache 2.0, du kannst es also kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen, anders als die Bedingungen der offenen Gewichte von Gemma.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.3 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 16.4 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 19.1 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 28.7 GB | 48 GB | Nahezu Original |
| F16 | 16 | 54.0 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~17.3 GB |
| 8K Token | ~1.8 GB | ~18.2 GB |
| 32K Token | ~7.3 GB | ~23.7 GB |
| 128K Token | ~29.0 GB | ~45.4 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3.5:27bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai