Kann ich Ministral 3 8B lokal ausführen?
Ministral 3 8B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~63 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Ministral 3 8B ist Mistrals Ende-2025-Interpretation des kleinen Allzweck-Modells für lokalen Betrieb und deckt Chat und Vision im selben 8B-Paket ab. Als 4-Bit-Quant liegt es bei rund 4.9 GB, passt also mit Reserve auf eine 8-GB-GPU und läuft problemlos im Unified Memory jedes Apple-Silicon-Macs. Die Angabe von 8 GB Mindest-RAM ist ehrlich auf die reinen Gewichte bezogen, was das Modell zu einer realistischen Wahl für ein Notebook oder eine günstige Gebraucht-GPU macht — eine Workstation braucht es dafür nicht.
Im Alltag fühlt es sich flott an. Auf einer RTX 3060 sind bei 4-Bit etwa 63 tok/s zu erwarten, eine 4090 schiebt das auf rund 177 tok/s, und ein M-Max liegt bei etwa 72 tok/s — alles schneller, als du eine gestreamte Antwort lesen kannst. Das Aushängeschild ist das 256K-Kontextfenster, aber behandle es als Obergrenze, nicht als Standard. Bei 128K Kontext steigt der gesamte Speicherbedarf auf etwa 21.7 GB, weit jenseits dessen, was eine 8-GB-Karte fasst. Halte den Arbeitskontext also bei wenigen tausend Tokens, sofern du nicht genug VRAM für das lange Fenster hast.
Gegenüber seinen Geschwistern hält es die Mitte: Mistral Nemo 12B bietet in der Regel mehr Spielraum für anspruchsvolleres Reasoning, wenn du dir das größere Modell leisten kannst, während Mistral 7B der schlankere Rückfall ist, wenn der Speicher knapp wird. Die herausragende Eigenschaft von Ministral 3 8B ist, dass Vision in denselben kleinen Footprint passt, du also Bildverständnis bekommst, ohne auf ein schwereres multimodales Modell umsteigen zu müssen. Es kommt unter Apache 2.0, das heißt: kommerzieller und produktiver Einsatz ohne anbieterspezifische Einschränkungen — eine wirklich saubere Lizenz für ein Modell dieser Leistungsklasse.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.9 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Nahezu Original |
| F16 | 16 | 16.0 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.4 GB |
| 8K Token | ~1.0 GB | ~5.9 GB |
| 32K Token | ~4.2 GB | ~9.1 GB |
| 128K Token | ~16.8 GB | ~21.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run ministral-3:8b