Kann ich Phi-4 Mini 3.8B lokal ausführen?
Phi-4 Mini 3.8B von Microsoft benötigt bei der empfohlenen 4-Bit-Quantisierung rund 6 GB RAM (2.3 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~133 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Phi-4 Mini 3.8B ist Microsofts kleines Chat-Modell – die richtige Wahl, wenn du etwas wirklich Leichtgewichtiges willst, das trotzdem ein Gespräch tragen kann. Mit 4-Bit-Quantisierung landet es bei rund 2.3 GB und sinkt bei 2-Bit auf etwa 1.6 GB, passt also fast überall hin: eine 6 GB GPU hat reichlich Luft, ein Einsteiger-M1-Mac führt es ohne Mühe aus, und selbst ein altes Notebook bewältigt es auf der CPU. Die MIT-Lizenz ist der einfache Teil – keine Bedingungen zu lesen, keine kommerziellen Einschränkungen, du kannst es also bedenkenlos in einem Produkt ausliefern.
Im Alltag ist es flott. Auf einer RTX 3060 siehst du etwa 133 tok/s, ein M-Max liegt bei rund 151 tok/s, und eine 4090 treibt es über 370 tok/s – damit deutlich schneller, als du lesen kannst. Die 128K Kontextlänge ist die Schlagzeile, aber behandle sie mit Vorsicht: Füllst du sie voll, steigt der Gesamtspeicher auf etwa 14.3 GB und liegt damit weit über den 6 GB, die das Modell im Ruhezustand braucht. Auf einer kleinen GPU hältst du den Arbeitskontext besser bei ein paar tausend Token, dann bleibst du im grünen Bereich. Selbst eine CPU auf DDR5 schafft bei kurzen Prompts noch rund 22 tok/s.
Wo seine Größe sichtbar wird, ist die Tiefe. Bei logischem Denken und mehrstufigen Anweisungen hat Qwen 3 4B in der Regel die Nase vorn, obwohl es etwa gleich viele Parameter besitzt; und wenn du echten Spielraum beim Reasoning brauchst, ist Phi-4 14B der naheliegende Schritt nach oben. Die herausragende Eigenschaft von Phi-4 Mini ist seine Effizienz: Bei einfachem Chat und Zusammenfassungen boxt es über seine 3.8B hinaus und bleibt dabei klein genug, um fast überall zu laufen – MIT-lizenziert und ohne Einschränkungen. Wenn du einen winzigen lokalen Assistenten willst, der schnell lädt und dir nicht im Weg steht, ist das eine starke Standardwahl.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.6 GB | 4 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 2.3 GB | 6 GB | Empfohlen |
| Q5_K_M | 5.65 | 2.7 GB | 6 GB | Hoch |
| Q8_0 | 8.5 | 4.0 GB | 8 GB | Nahezu Original |
| F16 | 16 | 7.6 GB | 12 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.4 GB | ~2.7 GB |
| 8K Token | ~0.8 GB | ~3.1 GB |
| 32K Token | ~3.0 GB | ~5.3 GB |
| 128K Token | ~12.0 GB | ~14.3 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~133 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~372 tok/s |
| Apple M-series (base) | 100 GB/s | ~37 tok/s |
| Apple M-series Pro | 270 GB/s | ~100 tok/s |
| Apple M-series Max | 410 GB/s | ~151 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~22 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run phi4-miniQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Microsoft.
github.comMicrosoft — offizielle Seite
Offizielle Seite und Dokumentation von Microsoft.
azure.microsoft.com