Kann ich Magistral Small 1.2 lokal ausführen?
Magistral Small 1.2 von Mistral AI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (14.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~24 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Magistral Small 1.2 ist Mistrals 24B-Reasoning-Modell und richtet sich an alle, die einen lokalen Assistenten wollen, der mehrstufige Probleme wirklich durchdenkt, statt nur zu plaudern. Es beherrscht auch Vision und allgemeine Konversation, aber das Reasoning ist der eigentliche Grund, dazu zu greifen. Zuerst sollte man den Speicherbedarf einplanen: Bei einer 4-Bit-Quantisierung landet es bei etwa 14.6 GB, und für komfortablen Betrieb braucht man rund 24 GB Arbeitsspeicher. Damit fällt eine 12-GB-Karte wie die RTX 3060 raus, auf der es schlicht nicht passt, und man landet bei einer 24-GB-GPU oder einem Apple-Silicon-Mac mit mehr Speicher.
Auf einer RTX 4090 liefert es rund 59 Tokens pro Sekunde, schnell genug, dass sich das schrittweise Reasoning nie wie Warten anfühlt. Auf einem M-Max liegt man eher bei 24 Tokens pro Sekunde, für interaktives Arbeiten immer noch bestens nutzbar, und reiner CPU-Betrieb auf DDR5 fällt auf etwa 4 Tokens pro Sekunde ab, in Ordnung für Batch-Jobs, aber nicht für Live-Chat. Die 128K Kontext sind echt, aber speicherhungrig: Füllt man sie komplett, klettert der Gesamtverbrauch auf rund 42 GB, deutlich mehr als eine einzelne 24-GB-Karte fasst. Halte den Arbeitskontext also moderat, sofern du keine Reserven hast.
Im Vergleich zu den Geschwistern ist Mistral Nemo 12B die leichtere, schnellere Wahl, wenn es dir vor allem um Chat geht und du den Speicher nicht erübrigen kannst, während Gemma 4 26B A4B bei ähnlicher Größe in der Regel direkter beim Reasoning, Coding und Vision mithält. Magistrals herausragendes Merkmal ist dieser Reasoning-Fokus in einem Modell, das dir vollständig gehört: Die Apache-2.0-Lizenz erlaubt kommerziellen und produktiven Einsatz ohne Auflagen seitens des Anbieters, was für einen leistungsfähigen 24B-Reasoner selten ist. Wenn du die 24 GB hast, um es zu füttern, gehört es zu den ernstzunehmenderen lokalen Denkmodellen, die verfügbar sind.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 14.6 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Hoch |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Nahezu Original |
| F16 | 16 | 48.0 GB | 64 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~15.5 GB |
| 8K Token | ~1.7 GB | ~16.3 GB |
| 32K Token | ~6.9 GB | ~21.5 GB |
| 128K Token | ~27.5 GB | ~42.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.