Kann ich Devstral 24B lokal ausführen?
Devstral 24B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (14.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~24 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Devstral 24B ist der Coding-Spezialist von Mistral AI, gebaut für alle, die einen leistungsfähigen lokalen Agenten für die Softwareentwicklung wollen statt eines allgemeinen Chat-Begleiters. Mit 24B dichten Parametern ist das Modell kein Leichtgewicht: Die 4-Bit-Quantisierung liegt bei rund 14,6 GB, und das Modell braucht mindestens etwa 24 GB RAM, um komfortabel zu laufen. Damit ist es für eine 12-GB-Karte wie die RTX 3060 unerreichbar, dort passt es schlicht nicht hinein. Die natürliche Heimat ist eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Wenn der Platz knapp ist, fällt der 2-Bit-Build auf etwa 10,1 GB.
Im täglichen Coding-Einsatz auf einer RTX 4090 kannst du mit rund 59 Tokens pro Sekunde bei 4-Bit rechnen, schnell genug, dass generierter Code flüssig durchläuft, während du ihn liest. Auf einem Apple M-Max pendelt es sich näher bei 24 Tokens pro Sekunde ein, weiterhin bestens nutzbar für interaktives Arbeiten, und reiner CPU-Betrieb auf DDR5 fällt auf etwa 4 Tokens pro Sekunde ab, was Geduld erfordert. Das 128K-Kontextfenster ist wirklich groß, aber nicht umsonst: Es voll auszuschöpfen treibt den Gesamtspeicher auf rund 42,1 GB, deutlich über den Ruheverbrauch des Modells hinaus, halte den Arbeitskontext also moderat, sofern du nicht genug Reserven übrig hast.
Im Vergleich zu seinen Geschwistern ist Devstral 24B das Schwergewicht: Mistral 7B und Mistral Nemo 12B sind deutlich leichter und auf allgemeinen Chat ausgelegt, sie laufen also auf Hardware, die für Devstral unerreichbar ist, hängen ihm bei echten Coding-Aufgaben aber meist hinterher. Der nähere Vergleich ist Gemma 4 26B A4B, ein ähnlich großes Modell, das neben Coding auch Chat, Reasoning und Vision beherrscht und tendenziell der vielseitigere Allrounder ist, wenn du ein Modell für alles willst. Devstrals herausragende Stärke ist sein enger Fokus auf Code, und die Apache-2.0-Lizenz bedeutet, dass du es frei einsetzen kannst, auch im kommerziellen Produktiveinsatz.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 14.6 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Hoch |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Nahezu Original |
| F16 | 16 | 48.0 GB | 64 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~15.5 GB |
| 8K Token | ~1.7 GB | ~16.3 GB |
| 32K Token | ~6.9 GB | ~21.5 GB |
| 128K Token | ~27.5 GB | ~42.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run devstralQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Mistral AI.
github.comMistral AI — offizielle Seite
Offizielle Seite und Dokumentation von Mistral AI.
mistral.ai