← Alle ModelleMODELL-CHECK

Kann ich Mistral Small 4 119B lokal ausführen?

Mistral Small 4 119B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (72.1 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~88 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Mistral Small 4 119B ist der Außenseiter dieser Familie: "small" im Namen, aber es bringt insgesamt 119B Parameter mit, als Mixture-of-Experts, das pro Token nur 6.5B aktiviert. Genau dieses Design ist der Grund, warum es bei der Geschwindigkeit über seiner aktiven Größe spielt – im Speicher zahlst du trotzdem für das ganze Modell. In 4-Bit landet es bei rund 72 GB, und du brauchst etwa 96 GB RAM, um es zu halten. Keine Consumer-GPU reicht hier: Eine RTX 3060 mit 12 GB und sogar eine RTX 4090 mit 24 GB fallen beide raus. Das ist ein Modell für Workstations oder Maschinen mit viel Unified Memory, keine Wahl fürs Laptop.

Im Alltag zahlt sich der MoE-Trick dort aus, wo es zählt. Auf einem Apple M Max mit viel Speicher läuft es mit nahezu 88 Tokens pro Sekunde, was sich für ein Modell dieser Größe flüssig wie ein Gespräch anfühlt, und selbst auf der CPU mit DDR5 bekommst du etwa 13 Tokens pro Sekunde, wenn du etwas Geduld mitbringst. Der 256K-Kontext ist auf dem Papier großzügig, aber behalte den Speicher im Auge: Bei 128K Kontext steigt der Gesamtbedarf auf rund 128.6 GB, das lange Fenster ist also nur real, wenn dein RAM es trägt. Betrachte den vollen Kontext als Frage des Hardware-Budgets, nicht als kostenlose Einstellung.

Innerhalb der eigenen Linie sind Mistral 7B und Nemo 12B die leichtgewichtigen, reinen Chat-Optionen, falls du keine 96 GB bereitstellen kannst; dieses Modell zieht bei Reasoning, Coding und Vision in der Regel davon, was jene beiden überhaupt nicht beherrschen. Sein nächster Konkurrent hier ist Nemotron 3 Super 120B-A12B, ein weiteres großes MoE in derselben Gewichtsklasse; die beiden liefern sich eher ein Kopf-an-Kopf-Rennen, als dass eines klar führt. Das Herausragende: Du bekommst ein Vier-Aufgaben-Modell (Chat, Reasoning, Coding, Vision) unter einer echten Apache 2.0-Lizenz, kommerzieller und produktiver Einsatz sind also vollständig erlaubt, ohne Auflagen seitens des Anbieters.

Technische Daten

Parameter119B (6.5B aktiv)
Kontextfenster256K Token
AnbieterMistral AI
LizenzApache 2.0
Veröffentlicht2026-03
Am besten fürChat, Logisches Denken, Programmieren, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3549.8 GB64 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8572.1 GB96 GBEmpfohlen
Q5_K_M5.6584.0 GB128 GBHoch
Q8_08.5126.4 GB192 GBNahezu Original
F1616238.0 GB256 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.8 GB~73.9 GB
8K Token~3.5 GB~75.6 GB
32K Token~14.1 GB~86.2 GB
128K Token~56.5 GB~128.6 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/sPasst nicht in den VRAM
Apple M-series (base)100 GB/s~22 tok/s
Apple M-series Pro270 GB/s~58 tok/s
Apple M-series Max410 GB/s~88 tok/s
CPU only (dual-channel DDR5)60 GB/s~13 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Häufig gestellte Fragen