Kann ich Qwen 2.5 Coder 32B lokal ausführen?
Qwen 2.5 Coder 32B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~18 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 2.5 Coder 32B ist Alibabas speziell für die Programmierung entwickeltes Modell und genau das, wozu man greift, wenn man einen lokalen Assistenten will, der bei echter Programmierarbeit tatsächlich mit gehosteten Tools mithält. Mit 32,8B Parametern ist es kein nebenbei erledigter Download: Eine 4-Bit-Quantisierung landet bei rund 19,9 GB, und zum Laden brauchst du mindestens 32 GB RAM. Damit fällt eine 12 GB RTX 3060 komplett raus, dort passt es schlicht nicht hinein. Realistisch zu Hause ist es auf einer 24-GB-Karte oder einem Apple-Silicon-Mac mit reichlich Unified Memory.
Im Alltag wirkt es eher bedächtig als flott, und der Hardware-Unterschied macht sich bemerkbar. Auf einer RTX 4090 kannst du bei 4-Bit mit etwa 43 tok/s rechnen, schnell genug, dass der Code beim Lesen angenehm durchläuft. Ein M-Series Max liegt näher bei 18 tok/s, nutzbar, aber spürbar geduldigeres Arbeiten, und ein DDR5-CPU-Fallback mit rund 3 tok/s eignet sich wirklich nur für nächtliche Batch-Jobs. Die 128K Kontext sind echt nützlich, um ganze Dateien einzuspeisen, aber sie gibt es nicht umsonst: Reizt du das volle Fenster aus, treibt das den Gesamtspeicher in Richtung 51,6 GB, halte den Arbeitskontext also moderat, wenn du keinen Spielraum hast.
Gegen DeepSeek R1 32B, das mit denselben 32,8B genauso groß ist, läuft die Trennlinie über die Absicht: R1 ist ein Reasoning-Modell, das laut denkt, während Qwen 2.5 Coder bei reiner Code-Generierung und -Vervollständigung in der Regel direkter und auf den Punkt wirkt. Seine herausragende Eigenschaft ist genau dieser Programmierfokus bei einer Größe, die du noch auf einer guten GPU selbst hosten kannst. Und die Lizenz ist der einfache Teil: Apache 2.0 bedeutet, dass du es frei nutzen kannst, auch kommerziell und in der Produktion, ohne anbieterspezifische Auflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 19.9 GB | 32 GB | Empfohlen |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Nahezu Original |
| F16 | 16 | 65.6 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.0 GB | ~20.9 GB |
| 8K Token | ~2.0 GB | ~21.9 GB |
| 32K Token | ~7.9 GB | ~27.8 GB |
| 128K Token | ~31.7 GB | ~51.6 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen2.5-coder:32bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai