← Alle ModelleMODELL-CHECK

Kann ich Devstral 24B lokal ausführen?

Devstral 24B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (14.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~24 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Devstral 24B ist der Coding-Spezialist von Mistral AI, gebaut für alle, die einen leistungsfähigen lokalen Agenten für die Softwareentwicklung wollen statt eines allgemeinen Chat-Begleiters. Mit 24B dichten Parametern ist das Modell kein Leichtgewicht: Die 4-Bit-Quantisierung liegt bei rund 14,6 GB, und das Modell braucht mindestens etwa 24 GB RAM, um komfortabel zu laufen. Damit ist es für eine 12-GB-Karte wie die RTX 3060 unerreichbar, dort passt es schlicht nicht hinein. Die natürliche Heimat ist eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Wenn der Platz knapp ist, fällt der 2-Bit-Build auf etwa 10,1 GB.

Im täglichen Coding-Einsatz auf einer RTX 4090 kannst du mit rund 59 Tokens pro Sekunde bei 4-Bit rechnen, schnell genug, dass generierter Code flüssig durchläuft, während du ihn liest. Auf einem Apple M-Max pendelt es sich näher bei 24 Tokens pro Sekunde ein, weiterhin bestens nutzbar für interaktives Arbeiten, und reiner CPU-Betrieb auf DDR5 fällt auf etwa 4 Tokens pro Sekunde ab, was Geduld erfordert. Das 128K-Kontextfenster ist wirklich groß, aber nicht umsonst: Es voll auszuschöpfen treibt den Gesamtspeicher auf rund 42,1 GB, deutlich über den Ruheverbrauch des Modells hinaus, halte den Arbeitskontext also moderat, sofern du nicht genug Reserven übrig hast.

Im Vergleich zu seinen Geschwistern ist Devstral 24B das Schwergewicht: Mistral 7B und Mistral Nemo 12B sind deutlich leichter und auf allgemeinen Chat ausgelegt, sie laufen also auf Hardware, die für Devstral unerreichbar ist, hängen ihm bei echten Coding-Aufgaben aber meist hinterher. Der nähere Vergleich ist Gemma 4 26B A4B, ein ähnlich großes Modell, das neben Coding auch Chat, Reasoning und Vision beherrscht und tendenziell der vielseitigere Allrounder ist, wenn du ein Modell für alles willst. Devstrals herausragende Stärke ist sein enger Fokus auf Code, und die Apache-2.0-Lizenz bedeutet, dass du es frei einsetzen kannst, auch im kommerziellen Produktiveinsatz.

Technische Daten

Parameter24B
Kontextfenster128K Token
AnbieterMistral AI
LizenzApache 2.0
Veröffentlicht2025-05
Am besten fürProgrammieren

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3510.1 GB16 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8514.6 GB24 GBEmpfohlen
Q5_K_M5.6517.0 GB24 GBHoch
Q8_08.525.5 GB48 GBNahezu Original
F161648.0 GB64 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.9 GB~15.5 GB
8K Token~1.7 GB~16.3 GB
32K Token~6.9 GB~21.5 GB
128K Token~27.5 GB~42.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~59 tok/s
Apple M-series (base)100 GB/s~6 tok/s
Apple M-series Pro270 GB/s~16 tok/s
Apple M-series Max410 GB/s~24 tok/s
CPU only (dual-channel DDR5)60 GB/s~4 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run devstral

Häufig gestellte Fragen

Devstral 24B Systemanforderungen — Kann ich es lokal ausführen?