Kann ich Codestral 22B lokal ausführen?
Codestral 22B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (13.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~26 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Codestral 22B ist das dedizierte Coding-Modell von Mistral AI, gebaut für Code-Vervollständigung und -Generierung statt für offenen Chat. Mit 22,2 Milliarden Parametern ist es ein echter Größensprung gegenüber den 7B-12B-Modellen, mit denen die meisten anfangen, und das zeigt sich am Speicherbedarf: ein 4-Bit-Quant landet bei rund 13,5 GB, und das Modell will mindestens 24 GB RAM, um flüssig zu laufen. Damit ist es für eine 12-GB-Karte wie die RTX 3060 außer Reichweite – dort passt es schlicht nicht hinein. Eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory ist der realistische Einstiegspunkt.
Auf einer RTX 4090 sind bei 4 Bit etwa 64 Tokens pro Sekunde zu erwarten – schnell genug, dass sich Code-Vorschläge nahezu sofort anfühlen. Ein Apple M-Max liegt mit rund 26 tok/s niedriger, bleibt aber für interaktives Editieren brauchbar, während reiner CPU-Betrieb auf DDR5 auf etwa 4 tok/s einbricht – das taugt wirklich nur für Batch-Jobs, die man laufen lassen und vergessen kann. Das Kontextfenster beträgt 32K, nach heutigen Maßstäben bescheiden, aber großzügig für die meisten Einzeldatei- und kleinen Repo-Aufgaben. Füllt man es vollständig, kommt man auf rund 20,1 GB Gesamtspeicher – auf einer 24-GB-Karte lässt ein voller Kontext also kaum Spielraum.
Im Vergleich zu seinen Geschwistern ist Codestral der Spezialist: Mistral Nemo 12B ist die leichtere, allgemeine Chat-Wahl, wenn der Speicher knapp ist, und GPT-OSS 20B hat beim Schlussfolgern und im Dialog meist die Nase vorn. Codestrals herausragende Eigenschaft ist, dass es gezielt auf Code in vielen Sprachen trainiert wurde, sodass es sich bei Fill-in-the-Middle-Vervollständigung und Generierung tendenziell treffsicherer anfühlt als ein gleich großer Generalist. Der ernste Vorbehalt ist die Lizenz: Codestral wird unter Mistrals MNPL ausgeliefert, einer Nicht-Produktions-Lizenz – du darfst es also nicht kommerziell oder in einem Produktionsprodukt einsetzen. Betrachte es ausschließlich als Werkzeug für Forschung und privaten Gebrauch.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 9.3 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 13.5 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 15.7 GB | 24 GB | Hoch |
| Q8_0 | 8.5 | 23.6 GB | 32 GB | Nahezu Original |
| F16 | 16 | 44.4 GB | 64 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.8 GB | ~14.3 GB |
| 8K Token | ~1.7 GB | ~15.2 GB |
| 32K Token | ~6.6 GB | ~20.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~64 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~17 tok/s |
| Apple M-series Max | 410 GB/s | ~26 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run codestralQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Mistral AI.
github.comMistral AI — offizielle Seite
Offizielle Seite und Dokumentation von Mistral AI.
mistral.ai