← Alle ModelleMODELL-CHECK

Kann ich Mistral Small 3.1 24B lokal ausführen?

Mistral Small 3.1 24B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (14.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~24 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Zu Mistral Small 3.1 24B greifst du, wenn dich ein 8B-Modell bei schwierigeren Prompts immer wieder enttäuscht, du aber nicht gleich auf ein 70B-Modell aufstocken willst. Es ist ein 24B-Modell für Chat und Vision, liest also Bilder genauso wie Text, und es kommt unter Apache 2.0 – das heißt, du darfst es ohne Einschränkungen kommerziell und in Produktion einsetzen. Der Haken ist der Speicherbedarf: bei einer 4-Bit-Quantisierung landet es bei rund 14.6 GB, und du brauchst etwa 24 GB Speicher, um es komfortabel zu betreiben. Damit fällt eine 12-GB-Karte wie die RTX 3060 raus, auf der es schlicht nicht passt, und du brauchst eine GPU mit 24 GB oder einen Apple-Silicon-Mac mit reichlich Unified Memory.

Auf einer 24-GB-Karte wie der RTX 4090 läuft es bei 4-Bit mit etwa 59 Tokens pro Sekunde – das streamt schneller, als du lesen kannst, und fühlt sich für ein Modell dieser Größe wirklich flott an. Auf einem M-Max liegst du eher bei rund 24 Tokens pro Sekunde, was für interaktiven Chat immer noch völlig brauchbar ist. Nur auf der CPU mit DDR5 sinkt das Tempo auf etwa 4 Tokens pro Sekunde – okay für einen Batch-Job über Nacht, aber nichts, wofür man wartend davorsitzen will. Das 128K-Kontextfenster ist echt, aber teuer: füllst du es komplett, klettert der Gesamtspeicher auf rund 42 GB, weit über das, was das Modell bei kurzem Kontext braucht. Halte den Arbeitskontext also bescheiden, solange du keinen Spielraum übrig hast.

Innerhalb der eigenen Familie ist es das Schwergewicht: Mistral Nemo 12B ist die leichtere, schnellere Wahl, wenn dein Speicher knapp ist, und Mistral 7B die absolute Minimal-Option, aber keines von beiden kommt bei schwierigerem Reasoning oder beim Befolgen von Anweisungen an Small 3.1 heran. Gemma 4 26B A4B ist der nähere Rivale bei der reinen Leistungsfähigkeit und punktet zusätzlich bei Coding und Reasoning – vergleiche also beide, falls dir genau diese Aufgaben am wichtigsten sind. Die herausragende Stärke von Small 3.1 ist die Kombination, die man selten zusammen bekommt: native Vision, ein langer Kontext und eine vollständig freizügige Apache-2.0-Lizenz. Das macht es zu einem der unkompliziertesten leistungsfähigen Modelle, das man tatsächlich in ein Produkt bringen kann.

Technische Daten

Parameter24B
Kontextfenster128K Token
AnbieterMistral AI
LizenzApache 2.0
Veröffentlicht2025-03
Am besten fürChat, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3510.1 GB16 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8514.6 GB24 GBEmpfohlen
Q5_K_M5.6517.0 GB24 GBHoch
Q8_08.525.5 GB48 GBNahezu Original
F161648.0 GB64 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.9 GB~15.5 GB
8K Token~1.7 GB~16.3 GB
32K Token~6.9 GB~21.5 GB
128K Token~27.5 GB~42.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~59 tok/s
Apple M-series (base)100 GB/s~6 tok/s
Apple M-series Pro270 GB/s~16 tok/s
Apple M-series Max410 GB/s~24 tok/s
CPU only (dual-channel DDR5)60 GB/s~4 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run mistral-small3.1

Häufig gestellte Fragen