← Alle ModelleMODELL-CHECK

Kann ich Qwen 2.5 Coder 32B lokal ausführen?

Qwen 2.5 Coder 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~18 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 2.5 Coder 32B ist Alibabas speziell für die Programmierung entwickeltes Modell und genau das, wozu man greift, wenn man einen lokalen Assistenten will, der bei echter Programmierarbeit tatsächlich mit gehosteten Tools mithält. Mit 32,8B Parametern ist es kein nebenbei erledigter Download: Eine 4-Bit-Quantisierung landet bei rund 19,9 GB, und zum Laden brauchst du mindestens 32 GB RAM. Damit fällt eine 12 GB RTX 3060 komplett raus, dort passt es schlicht nicht hinein. Realistisch zu Hause ist es auf einer 24-GB-Karte oder einem Apple-Silicon-Mac mit reichlich Unified Memory.

Im Alltag wirkt es eher bedächtig als flott, und der Hardware-Unterschied macht sich bemerkbar. Auf einer RTX 4090 kannst du bei 4-Bit mit etwa 43 tok/s rechnen, schnell genug, dass der Code beim Lesen angenehm durchläuft. Ein M-Series Max liegt näher bei 18 tok/s, nutzbar, aber spürbar geduldigeres Arbeiten, und ein DDR5-CPU-Fallback mit rund 3 tok/s eignet sich wirklich nur für nächtliche Batch-Jobs. Die 128K Kontext sind echt nützlich, um ganze Dateien einzuspeisen, aber sie gibt es nicht umsonst: Reizt du das volle Fenster aus, treibt das den Gesamtspeicher in Richtung 51,6 GB, halte den Arbeitskontext also moderat, wenn du keinen Spielraum hast.

Gegen DeepSeek R1 32B, das mit denselben 32,8B genauso groß ist, läuft die Trennlinie über die Absicht: R1 ist ein Reasoning-Modell, das laut denkt, während Qwen 2.5 Coder bei reiner Code-Generierung und -Vervollständigung in der Regel direkter und auf den Punkt wirkt. Seine herausragende Eigenschaft ist genau dieser Programmierfokus bei einer Größe, die du noch auf einer guten GPU selbst hosten kannst. Und die Lizenz ist der einfache Teil: Apache 2.0 bedeutet, dass du es frei nutzen kannst, auch kommerziell und in der Produktion, ohne anbieterspezifische Auflagen.

Technische Daten

Parameter32.8B
Kontextfenster128K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2024-11
Am besten fürProgrammieren

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3513.7 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8519.9 GB32 GBEmpfohlen
Q5_K_M5.6523.2 GB32 GBHoch
Q8_08.534.8 GB48 GBNahezu Original
F161665.6 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~20.9 GB
8K Token~2.0 GB~21.9 GB
32K Token~7.9 GB~27.8 GB
128K Token~31.7 GB~51.6 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen2.5-coder:32b

Häufig gestellte Fragen

Qwen 2.5 Coder 32B Systemanforderungen — Kann ich es lokal ausführen?