Kann ich Ministral 3 14B lokal ausführen?
Ministral 3 14B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (8.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~36 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Ministral 3 14B ist Mistrals Mittelklasse-Modell vom Dezember 2025, ein dichtes Netz mit 14B Parametern, das zusätzlich Vision beherrscht. Damit ist es die richtige Wahl, wenn man ein einziges lokales Modell will, das chattet und Bilder liest, ohne mit zwei Checkpoints zu jonglieren. Als 4-Bit-Quant landet es bei rund 8.5 GB, also knapp über dem, was eine 8-GB-Karte bequem fasst, aber genau passend für eine 12 GB RTX 3060 oder jeden Apple-Silicon-Mac mit 16 GB Unified Memory oder mehr. Wer knapp dran ist, greift zum 2-Bit-Build und schrumpft auf etwa 5.9 GB; der q8-Build liegt eher bei 15 GB.
Im Alltag wirkt es flott für seine Größe. Auf einer RTX 3060 12 GB siehst du bei 4-Bit rund 36 Tokens pro Sekunde, bequem schneller als Lesegeschwindigkeit, und eine RTX 4090 treibt das auf grob 101 tok/s. Ein M-Max liegt bei etwa 41 tok/s. Das 256K-Kontextfenster ist die Schlagzeile, aber behandle es als Obergrenze, nicht als Standard: Selbst bei 128K klettert der Gesamtspeicher auf rund 30 GB, sobald sich der KV-Cache füllt – weit jenseits eines einzelnen 12-GB- oder 16-GB-Geräts. Halte den Arbeitskontext bei wenigen tausend Tokens, sofern du keine Karte mit 24 GB oder mehr übrig hast.
Im Vergleich zur Nachbarschaft hat Ministral 3 14B bei schwierigeren, mehrstufigen Prompts in der Regel die Nase vorn gegenüber älteren Geschwistern wie Mistral 7B und Mistral Nemo 12B – schlicht, weil es größer und neuer ist. OLMo 2 13B ist dagegen die Alternative mit vollständig offenen Trainingsdaten, falls dir Reproduzierbarkeit wichtiger ist als reine Leistung. Sein wahres Alleinstellungsmerkmal ist die integrierte Vision-Fähigkeit in dieser Größe mit einem wirklich brauchbaren Geschwindigkeitsprofil. Und die Lizenz ist der einfache Teil: Apache 2.0, du kannst es also kommerziell und produktiv einsetzen, ohne anbieterspezifische Auflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.9 GB | 12 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 8.5 GB | 16 GB | Empfohlen |
| Q5_K_M | 5.65 | 9.9 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 14.9 GB | 24 GB | Nahezu Original |
| F16 | 16 | 28.0 GB | 48 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.7 GB | ~9.2 GB |
| 8K Token | ~1.3 GB | ~9.8 GB |
| 32K Token | ~5.4 GB | ~13.9 GB |
| 128K Token | ~21.6 GB | ~30.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~36 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~101 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~27 tok/s |
| Apple M-series Max | 410 GB/s | ~41 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run ministral-3:14b