← Alle ModelleMODELL-CHECK

Kann ich Phi-4 14B lokal ausführen?

Phi-4 14B von Microsoft benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (8.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Phi-4 14B ist Microsofts kompaktes Reasoning-Modell, gedacht für alle, die mehr Logik und strukturiertes Denken brauchen, als ein typisches 7-8B-Chatmodell liefert, ohne gleich zu etwas zu greifen, das eine Workstation voraussetzt. Mit 14,7B Parametern landet es bei 4-Bit-Quantisierung um die 8.9 GB, passt also nicht mit komfortablem Spielraum auf eine schlichte 8-GB-Karte; die Untergrenze von 16 GB RAM ist der ehrliche Mindestwert. Eine 12-GB-RTX 3060, ein Apple-Silicon-Mac mit 16 GB oder jede GPU mit Reserve jenseits von 9 GB ist das natürliche Zuhause. Zur 2-Bit-Variante bei rund 6.2 GB greifst du nur, wenn es wirklich eng wird.

Im Alltag wirkt es eher bedächtig als flink, was zu seiner Reasoning-Ausrichtung passt. Auf einer 12-GB-RTX 3060 sind etwa 34 Token pro Sekunde bei 4-Bit zu erwarten, angenehm für Chat und Schritt-für-Schritt-Aufgaben; eine RTX 4090 schiebt das auf rund 96, und ein M-Max liegt bei etwa 39. Das Kontextfenster ist hier die eigentliche Einschränkung: Mit 16K ist es nach heutigen Maßstäben bescheiden, und schon das Füllen von 8K treibt den Gesamtspeicher auf rund 10.3 GB. Halte den aktiven Kontext schlank, dann bleibst du klar innerhalb einer 12-GB-Karte.

Gegen Qwen 3 14B, nahezu identisch in der Größe und mit demselben Fokus auf Chat und Reasoning, tauscht Phi-4 in der Regel breites Weltwissen gegen kompaktes, sauber strukturiertes Reasoning bei genau den Mathe- und Logik-Prompts, auf die Microsoft es getrimmt hat; Qwen wirkt bei offenen Aufgaben meist vielseitiger. Wenn du etwas Leichteres willst, ist Phi-4 Mini 3.8B dieselbe Familie zu einem Bruchteil des Speicherbedarfs. Phi-4s herausragende Eigenschaft ist, dass es beim strukturierten Reasoning über seiner Parameterzahl spielt, und die MIT-Lizenz ist der einfache Teil: frei nutzbar, kommerzielle Nutzung inklusive, keine Auflagen seitens des Anbieters.

Technische Daten

Parameter14.7B
Kontextfenster16K Token
AnbieterMicrosoft
LizenzMIT
Veröffentlicht2024-12
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.356.2 GB12 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.858.9 GB16 GBEmpfohlen
Q5_K_M5.6510.4 GB16 GBHoch
Q8_08.515.6 GB24 GBNahezu Original
F161629.4 GB48 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.7 GB~9.6 GB
8K Token~1.4 GB~10.3 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~96 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run phi4

Häufig gestellte Fragen