Kann ich Devstral Small 2 24B lokal ausführen?
Devstral Small 2 24B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (14.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~24 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Devstral Small 2 ist Mistrals 24B-Coding-Modell, und der Name lässt nicht ahnen, wie viel Hardware es einfordert. Mit 4-Bit-Quantisierung landet es bei rund 14,6 GB an Gewichten, womit die 12-GB-Karten der meisten Leute ausscheiden: Auf einer RTX 3060 passt es schlicht nicht. Realistisch willst du 24 GB Speicher, um es bequem zu betreiben — in der Praxis heißt das eine 24-GB-GPU wie eine 4090 oder ein Apple-Silicon-Mac mit mindestens 24 GB Unified Memory. Gehst du auf 2-Bit-Quantisierung runter, schrumpft es auf etwa 10,1 GB, aber das ist ein heftiger Qualitätskompromiss für ein Modell, dessen ganzer Sinn sorgfältige Codegenerierung ist.
Auf einer 4090 kannst du mit 4-Bit rund 59 Tokens pro Sekunde erwarten, was für eine agentische Coding-Schleife — Dateien lesen, planen, editieren — wirklich angenehm ist. Auf einem M-Max pendelt es sich näher bei ~24 tok/s ein, für interaktives Arbeiten noch brauchbar, aber bei längeren Generierungen spürst du es. Der vielbeworbene 256K-Kontext ist echt und nützlich, um ganze Repositories zu füttern, aber sei ehrlich zu den Kosten: Schon bei 128K beziffert das Datenblatt den Gesamtspeicher auf knapp 42,1 GB, weit jenseits einer einzelnen 24-GB-Karte. Behandle den großen Kontext als etwas, zu dem du bewusst greifst, nicht als Standard, den du offen lässt.
Gegenüber seinen Geschwistern ist Devstral die Wahl für ernsthafte Arbeit: Mistral 7B und Mistral Nemo 12B sind leichter und einfacher zu hosten, aber bei mehrstufigen Coding-Aufgaben meist schwächer, während Gemma 4 26B A4B der nächste Verwandte für Coding und Reasoning ist und einen direkten Vergleich wert ist, wenn du den Speicher hast. Was Devstral hervorhebt: Es wurde für agentisches, werkzeugnutzendes Code-Editing gebaut statt für One-Shot-Chat, und dieser Fokus zeigt sich darin, wie es einem Plan über mehrere Dateien hinweg folgt. Die Lizenz ist Apache 2.0, du kannst es also ohne Einschränkungen kommerziell und in der Produktion einsetzen — selten für ein derart leistungsfähiges Modell.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 14.6 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Hoch |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Nahezu Original |
| F16 | 16 | 48.0 GB | 64 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~15.5 GB |
| 8K Token | ~1.7 GB | ~16.3 GB |
| 32K Token | ~6.9 GB | ~21.5 GB |
| 128K Token | ~27.5 GB | ~42.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run devstral-small-2:24b