← Alle ModelleMODELL-CHECK

Kann ich Qwen 3.5 27B lokal ausführen?

Qwen 3.5 27B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (16.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~21 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3.5 27B ist das Modell, zu dem du greifst, wenn ein 8B zu dünn wirkt und du echte Hardware zur Verfügung hast. Es ist ein dichtes 27B, das Chat, Reasoning, Coding und Vision beherrscht und damit als lokales Arbeitspferd taugt statt als Assistent für nur eine Aufgabe. Der Haken ist der Speicherbedarf: in 4-Bit landet es bei rund 16,4 GB, und du brauchst mindestens 24 GB RAM, um es sauber zu laden. Das schließt eine 12-GB-Karte wie die RTX 3060 aus, auf der es schlicht nicht passt, und verweist dich auf eine 24-GB-GPU oder einen Apple-Silicon-Mac mit reichlich Unified Memory.

Auf einer RTX 4090 kannst du in 4-Bit mit rund 52 Tokens pro Sekunde rechnen, was schneller streamt, als du liest, und für interaktives Arbeiten angenehm bleibt. Auf einem M-Max pendelt es sich bei etwa 21 Tokens pro Sekunde ein, weiterhin gut für Chat und Coding, aber langsamer bei langen Generierungen; reine CPU auf DDR5 fällt auf grob 3 Tokens pro Sekunde, was klar Geduldssache ist. Die 256K Kontext sind die Schlagzeile, aber behandle sie als Obergrenze: bei 128K klettert der Gesamtspeicher auf etwa 45,4 GB, halte den Arbeitskontext auf einer 24-GB-Karte also deutlich unter dem Maximum.

Der naheliegende Vergleich ist Gemma 3 27B, das andere offene 27B mit Vision in dieser Größenklasse. Gemma ist tendenziell die sichere Wahl, wenn es dir vor allem um ausgefeilten Chat und Bildverständnis geht, während Qwen 3.5 27B im Allgemeinen bei Coding und strukturiertem Reasoning stärker auftritt, und genau dort liegt sein herausragender Wert für Entwickler. Der große praktische Pluspunkt ist die Lizenz: es kommt unter Apache 2.0, du kannst es also kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen, anders als die Bedingungen der offenen Gewichte von Gemma.

Technische Daten

Parameter27B
Kontextfenster256K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2026-02
Am besten fürChat, Logisches Denken, Programmieren, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3511.3 GB16 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8516.4 GB24 GBEmpfohlen
Q5_K_M5.6519.1 GB32 GBHoch
Q8_08.528.7 GB48 GBNahezu Original
F161654.0 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.9 GB~17.3 GB
8K Token~1.8 GB~18.2 GB
32K Token~7.3 GB~23.7 GB
128K Token~29.0 GB~45.4 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~52 tok/s
Apple M-series (base)100 GB/s~5 tok/s
Apple M-series Pro270 GB/s~14 tok/s
Apple M-series Max410 GB/s~21 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3.5:27b

Häufig gestellte Fragen