Kann ich Phi-4 14B lokal ausführen?
Phi-4 14B von Microsoft benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (8.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Phi-4 14B ist Microsofts kompaktes Reasoning-Modell, gedacht für alle, die mehr Logik und strukturiertes Denken brauchen, als ein typisches 7-8B-Chatmodell liefert, ohne gleich zu etwas zu greifen, das eine Workstation voraussetzt. Mit 14,7B Parametern landet es bei 4-Bit-Quantisierung um die 8.9 GB, passt also nicht mit komfortablem Spielraum auf eine schlichte 8-GB-Karte; die Untergrenze von 16 GB RAM ist der ehrliche Mindestwert. Eine 12-GB-RTX 3060, ein Apple-Silicon-Mac mit 16 GB oder jede GPU mit Reserve jenseits von 9 GB ist das natürliche Zuhause. Zur 2-Bit-Variante bei rund 6.2 GB greifst du nur, wenn es wirklich eng wird.
Im Alltag wirkt es eher bedächtig als flink, was zu seiner Reasoning-Ausrichtung passt. Auf einer 12-GB-RTX 3060 sind etwa 34 Token pro Sekunde bei 4-Bit zu erwarten, angenehm für Chat und Schritt-für-Schritt-Aufgaben; eine RTX 4090 schiebt das auf rund 96, und ein M-Max liegt bei etwa 39. Das Kontextfenster ist hier die eigentliche Einschränkung: Mit 16K ist es nach heutigen Maßstäben bescheiden, und schon das Füllen von 8K treibt den Gesamtspeicher auf rund 10.3 GB. Halte den aktiven Kontext schlank, dann bleibst du klar innerhalb einer 12-GB-Karte.
Gegen Qwen 3 14B, nahezu identisch in der Größe und mit demselben Fokus auf Chat und Reasoning, tauscht Phi-4 in der Regel breites Weltwissen gegen kompaktes, sauber strukturiertes Reasoning bei genau den Mathe- und Logik-Prompts, auf die Microsoft es getrimmt hat; Qwen wirkt bei offenen Aufgaben meist vielseitiger. Wenn du etwas Leichteres willst, ist Phi-4 Mini 3.8B dieselbe Familie zu einem Bruchteil des Speicherbedarfs. Phi-4s herausragende Eigenschaft ist, dass es beim strukturierten Reasoning über seiner Parameterzahl spielt, und die MIT-Lizenz ist der einfache Teil: frei nutzbar, kommerzielle Nutzung inklusive, keine Auflagen seitens des Anbieters.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.2 GB | 12 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 8.9 GB | 16 GB | Empfohlen |
| Q5_K_M | 5.65 | 10.4 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 15.6 GB | 24 GB | Nahezu Original |
| F16 | 16 | 29.4 GB | 48 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.7 GB | ~9.6 GB |
| 8K Token | ~1.4 GB | ~10.3 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~96 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~26 tok/s |
| Apple M-series Max | 410 GB/s | ~39 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run phi4Quellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Microsoft.
github.comMicrosoft — offizielle Seite
Offizielle Seite und Dokumentation von Microsoft.
azure.microsoft.com