Kann ich Qwen 2.5 Coder 7B lokal ausführen?
Qwen 2.5 Coder 7B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~66 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 2.5 Coder 7B ist das Modell der Wahl, wenn du einen lokalen Coding-Assistenten statt eines allgemeinen Chatbots willst. Mit 7.6B Parametern ist es gezielt dafür gebaut, Code zu schreiben, zu vervollständigen und zu erklären, und genau dieser Fokus hebt es von den 7-8B-Allroundern ab, mit denen die meisten anfangen. Ein 4-bit-Quant landet bei rund 4.6 GB, passt also mit Luft nach oben auf eine 12 GB-Karte wie die RTX 3060, läuft bequem im Unified Memory eines Apple-Silicon-Macs und bleibt innerhalb der 8 GB Mindest-RAM, die das Modell braucht. Wenn der Speicher knapp ist, fällt ein 2-bit-Build auf etwa 3.2 GB, dafür gibst du aber etwas Genauigkeit her.
Im Alltag fühlt es sich schnell genug an, um es als Inline-Completion-Engine zu nutzen. Auf einer RTX 3060 12GB kannst du mit rund 66 tokens per second bei 4-bit rechnen, ein Apple M Max liegt bei etwa 76, beide schnell genug, dass die Vorschläge erscheinen, bevor du sie zu Ende gelesen hast; eine RTX 4090 treibt das auf grob 186. Der 128K-Kontext ist wirklich nützlich, um ganze Dateien oder ein kleines Repo zu füttern, aber behandle ihn als Obergrenze, nicht als Standard. Den vollen 128K auszunutzen treibt den Gesamtspeicher auf etwa 21 GB, was deutlich über eine einzelne 12 GB-Karte hinausgeht, halte den Arbeitskontext also auf das, was die Aufgabe tatsächlich braucht.
Im Vergleich zu den anderen Modellen auf dieser Seite ist DeepSeek R1 7B die bessere Wahl, wenn du schrittweises Reasoning oder Chain-of-Thought-Problemlösung willst, denn genau darauf ist es getrimmt; Qwen 2.5 Coder 7B hat bei der reinen Code-Generierung und beim Fixen bestehender Funktionen meist die Nase vorn. Seine herausragende Eigenschaft ist schlicht, ein scharfer, dedizierter Coder in einer Größe zu sein, die auf bescheidener Hardware läuft. Es kommt unter Apache 2.0, das heißt, du kannst es frei einsetzen, auch in kommerziellen und Produktivprojekten, ohne anbieterspezifische Auflagen, und es lässt sich sauber über Ollama als qwen2.5-coder ziehen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.2 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.6 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.4 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.1 GB | 12 GB | Nahezu Original |
| F16 | 16 | 15.2 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.1 GB |
| 8K Token | ~1.0 GB | ~5.6 GB |
| 32K Token | ~4.1 GB | ~8.7 GB |
| 128K Token | ~16.4 GB | ~21.0 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~66 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~186 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~50 tok/s |
| Apple M-series Max | 410 GB/s | ~76 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen2.5-coderQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai