Kann ich Mistral 7B lokal ausführen?
Mistral 7B von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.4 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~70 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Mistral 7B war das Modell, das als Erstes bewies, dass ein kleines Open-Weight-LLM wirklich nützlich sein kann, und es bleibt eine vernünftige Wahl für alle, die einen schlanken lokalen Chat-Assistenten suchen. Mit 4-Bit-Quantisierung landet es bei rund 4.4 GB und passt damit locker auf eine 8-GB-GPU, läuft problemlos im Unified Memory jedes Apple-Silicon-Macs, und selbst ein 2-Bit-Build mit etwa 3 GB ist drin, wenn du es auf ältere Hardware quetschst. Seine Apache-2.0-Lizenz ist so permissiv wie es nur geht: frei kommerziell nutzbar, ohne Auflagen seitens des Anbieters.
Im Alltag ist es schnell und zuverlässig für Chat und kurze Zusammenfassungen. Auf einer RTX 4090 schafft es bei 4-Bit rund 196 Tokens pro Sekunde, und selbst eine bescheidene RTX 3060 12GB hält etwa 70 tok/s, also schneller als du lesen kannst; ein M-Series Max liegt bei knapp 80 tok/s. Das Kontextfenster von 32K ist bequem, aber nicht riesig, und es komplett zu füllen treibt den Gesamtspeicher auf rund 8.4 GB. Auf einer knappen 8-GB-Karte hältst du den Arbeitskontext also besser moderat, statt das ganze Fenster vollzupacken.
Der ehrliche Vorbehalt ist das Alter: Ende 2023 veröffentlicht, hängt es bei anspruchsvollerem Reasoning und Instruction-Following hinter neueren kleinen Modellen zurück, und Mistral Nemo 12B kommt mit längeren, fordernderen Prompts in der Regel besser zurecht, wenn du den Speicher übrig hast. Speziell fürs Coding ist Qwen 2.5 Coder 7B bei vergleichbarer Größe meist die stärkere Wahl. Wo Mistral 7B nach wie vor punktet, sind Einfachheit und Reichweite: Es ist winzig, vollständig offen unter Apache 2.0 und hat jahrelang gewachsenes Tooling hinter dem schlichten 'mistral'-Tag in Ollama, was es zu einer verlässlichen Baseline ohne Überraschungen macht.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.0 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.4 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.1 GB | 8 GB | Hoch |
| Q8_0 | 8.5 | 7.7 GB | 12 GB | Nahezu Original |
| F16 | 16 | 14.4 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~4.9 GB |
| 8K Token | ~1.0 GB | ~5.4 GB |
| 32K Token | ~4.0 GB | ~8.4 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~70 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~196 tok/s |
| Apple M-series (base) | 100 GB/s | ~19 tok/s |
| Apple M-series Pro | 270 GB/s | ~53 tok/s |
| Apple M-series Max | 410 GB/s | ~80 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~12 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run mistralQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Mistral AI.
github.comMistral AI — offizielle Seite
Offizielle Seite und Dokumentation von Mistral AI.
mistral.ai