← Alle ModelleMODELL-CHECK

Kann ich Ministral 3 14B lokal ausführen?

Ministral 3 14B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (8.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~36 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Ministral 3 14B ist Mistrals Mittelklasse-Modell vom Dezember 2025, ein dichtes Netz mit 14B Parametern, das zusätzlich Vision beherrscht. Damit ist es die richtige Wahl, wenn man ein einziges lokales Modell will, das chattet und Bilder liest, ohne mit zwei Checkpoints zu jonglieren. Als 4-Bit-Quant landet es bei rund 8.5 GB, also knapp über dem, was eine 8-GB-Karte bequem fasst, aber genau passend für eine 12 GB RTX 3060 oder jeden Apple-Silicon-Mac mit 16 GB Unified Memory oder mehr. Wer knapp dran ist, greift zum 2-Bit-Build und schrumpft auf etwa 5.9 GB; der q8-Build liegt eher bei 15 GB.

Im Alltag wirkt es flott für seine Größe. Auf einer RTX 3060 12 GB siehst du bei 4-Bit rund 36 Tokens pro Sekunde, bequem schneller als Lesegeschwindigkeit, und eine RTX 4090 treibt das auf grob 101 tok/s. Ein M-Max liegt bei etwa 41 tok/s. Das 256K-Kontextfenster ist die Schlagzeile, aber behandle es als Obergrenze, nicht als Standard: Selbst bei 128K klettert der Gesamtspeicher auf rund 30 GB, sobald sich der KV-Cache füllt – weit jenseits eines einzelnen 12-GB- oder 16-GB-Geräts. Halte den Arbeitskontext bei wenigen tausend Tokens, sofern du keine Karte mit 24 GB oder mehr übrig hast.

Im Vergleich zur Nachbarschaft hat Ministral 3 14B bei schwierigeren, mehrstufigen Prompts in der Regel die Nase vorn gegenüber älteren Geschwistern wie Mistral 7B und Mistral Nemo 12B – schlicht, weil es größer und neuer ist. OLMo 2 13B ist dagegen die Alternative mit vollständig offenen Trainingsdaten, falls dir Reproduzierbarkeit wichtiger ist als reine Leistung. Sein wahres Alleinstellungsmerkmal ist die integrierte Vision-Fähigkeit in dieser Größe mit einem wirklich brauchbaren Geschwindigkeitsprofil. Und die Lizenz ist der einfache Teil: Apache 2.0, du kannst es also kommerziell und produktiv einsetzen, ohne anbieterspezifische Auflagen.

Technische Daten

Parameter14B
Kontextfenster256K Token
AnbieterMistral AI
LizenzApache 2.0
Veröffentlicht2025-12
Am besten fürChat, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.355.9 GB12 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.858.5 GB16 GBEmpfohlen
Q5_K_M5.659.9 GB16 GBHoch
Q8_08.514.9 GB24 GBNahezu Original
F161628.0 GB48 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.7 GB~9.2 GB
8K Token~1.3 GB~9.8 GB
32K Token~5.4 GB~13.9 GB
128K Token~21.6 GB~30.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~36 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~101 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~27 tok/s
Apple M-series Max410 GB/s~41 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run ministral-3:14b

Häufig gestellte Fragen