Kann ich Mistral Nemo 12B lokal ausführen?
Mistral Nemo 12B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 12 GB RAM (7.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~41 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Mistral Nemo 12B ist das Modell, zu dem man greift, wenn ein 8B etwas zu mager wirkt, man aber trotzdem etwas möchte, das auf eine einzelne Consumer-GPU passt. Es ist ein dichtes 12,2B-Chat-Modell von Mistral AI, und mit 4-Bit-Quantisierung landet es bei rund 7,4 GB, was sauber auf eine 12-GB-Karte wie eine RTX 3060 passt, mit Platz für den Kontext. Zum Laden braucht es minimal etwa 12 GB RAM, läuft also bequem auf einem Apple-Silicon-Mac mit 16 GB oder mehr, und es schleppt sich notfalls auch über die CPU, wenn nichts anderes da ist.
Im Alltag fühlt es sich wie ein wohlerzogener Allzweck-Assistent an: zuverlässig beim Chatten, Zusammenfassen und Umschreiben, ohne die gelegentliche Unzuverlässigkeit kleinerer Modelle. Auf einer RTX 3060 kannst du mit etwa 41 tok/s bei 4-Bit rechnen, ein M-series Max bringt es auf rund 47 tok/s – beides schneller, als du lesen kannst. Das 128K-Kontextfenster ist echt, aber nicht umsonst: Füllt man es komplett, klettert der Gesamtspeicher auf etwa 27,7 GB, weit über das, was eine einzelne 12-GB-Karte fasst. Halte den Arbeitskontext also moderat, sofern du keine 24-GB-GPU oder reichlich Unified Memory hast.
Im Vergleich zu seinen Nachbarn hat Mistral Small 3.1 24B in der Regel die Nase vorn beim anspruchsvolleren Reasoning und bietet zusätzlich Bildverarbeitung, während Gemma 3 12B die gleich große Alternative ist, wenn du Bildeingabe möchtest, die Nemo nicht bietet. Nemos herausragende Stärke ist sein Sweet Spot: ein chat-fokussiertes 12B, das auf einer gängigen GPU bleibt und unter Apache 2.0 ausgeliefert wird – du darfst es also kommerziell und in der Produktion ohne Einschränkungen nutzen. Wenn du einen leistungsfähigen Text-Assistenten willst, der lokal einfach funktioniert und nie eine Lizenzfrage aufwirft, ist das eine leichte Wahl.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.1 GB | 8 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 7.4 GB | 12 GB | Empfohlen |
| Q5_K_M | 5.65 | 8.6 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 13.0 GB | 24 GB | Nahezu Original |
| F16 | 16 | 24.4 GB | 32 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.6 GB | ~8.0 GB |
| 8K Token | ~1.3 GB | ~8.7 GB |
| 32K Token | ~5.1 GB | ~12.5 GB |
| 128K Token | ~20.3 GB | ~27.7 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~41 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~116 tok/s |
| Apple M-series (base) | 100 GB/s | ~11 tok/s |
| Apple M-series Pro | 270 GB/s | ~31 tok/s |
| Apple M-series Max | 410 GB/s | ~47 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run mistral-nemoQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Mistral AI.
github.comMistral AI — offizielle Seite
Offizielle Seite und Dokumentation von Mistral AI.
mistral.ai