Kann ich Ministral 3 3B lokal ausführen?
Ministral 3 3B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 4 GB RAM (1.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~168 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Ministral 3 3B ist Mistrals Antwort auf die Frage "Was ist das kleinste Modell, das sich noch wie ein echter Assistent anfühlt?" Mit 3B Parametern ist es für Chat und leichte Vision-Aufgaben auf Hardware gebaut, die du ohnehin schon besitzt. Eine 4-Bit-Quantisierung landet bei etwa 1.8 GB, und die q2-Variante lässt sich auf 1.3 GB drücken, wenn es wirklich eng wird. Mit minimal 4 GB RAM läuft es auf einem Einsteiger-Laptop, einer alten 4-GB-GPU oder jedem Apple-Silicon-Mac, ohne dass du über den Speicher nachdenken musst. Das ist das Modell, zu dem du greifst, wenn ein größeres nicht mehr passt.
Im Alltag ist die Geschwindigkeit das Highlight. Auf einer RTX 3060 siehst du rund 168 tok/s, ein M-Max schiebt etwa 192, und eine 4090 erreicht ca. 471 - allesamt deutlich schneller, als du lesen kannst, sodass Antworten sofort wirken. Reiner CPU-Betrieb auf DDR5 schafft immer noch etwa 28 tok/s, brauchbar für Batch-Aufgaben. Das Kontextfenster ist mit 256K großzügig, doch behandle das als Obergrenze. Es zu füllen wird schnell teuer: Bei 128K Kontext steigt die gesamte Speicherlast auf rund 12.6 GB, weit über den Eigenbedarf des Modells hinaus - halte den Arbeitskontext auf kleinen Maschinen also bescheiden.
Ehrlich gesagt tauschst du bei 3B etwas Tiefe gegen diese Geschwindigkeit und den winzigen Speicherbedarf. Mistral 7B hält bei schwierigerem Reasoning und längeren Instruktionsketten in der Regel besser stand, und Mistral Nemo 12B zieht erneut davon, sofern du den Speicher übrig hast. Wo Ministral 3 3B punktet, ist die Kombination aus purem Durchsatz und der Tatsache, dass es zusätzlich Vision beherrscht - was die größeren, reinen Chat-Mistrals nicht tun. Es kommt unter Apache 2.0, du kannst es also ohne Einschränkungen kommerziell nutzen. Für ein schnelles, kostenloses Alleskönner-Kleinmodell verdient es sich seinen Platz.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.3 GB | 4 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 1.8 GB | 4 GB | Empfohlen |
| Q5_K_M | 5.65 | 2.1 GB | 6 GB | Hoch |
| Q8_0 | 8.5 | 3.2 GB | 6 GB | Nahezu Original |
| F16 | 16 | 6.0 GB | 12 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.3 GB | ~2.1 GB |
| 8K Token | ~0.7 GB | ~2.5 GB |
| 32K Token | ~2.7 GB | ~4.5 GB |
| 128K Token | ~10.8 GB | ~12.6 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~168 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run ministral-3:3b