← Alle ModelleMODELL-CHECK

Kann ich Phi-4 Reasoning Vision 15B lokal ausführen?

Phi-4 Reasoning Vision 15B von Microsoft benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (9.1 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Phi-4 Reasoning Vision 15B ist Microsofts Open-Weight-Modell (unter MIT-Lizenz, also frei kommerziell nutzbar), das auf Vision und Reasoning ausgelegt ist statt auf allgemeinen Chat. Es ist ein dichtes Modell mit 15B Parametern, das heißt das gesamte Modell wird geladen und läuft bei jedem Token mit. Bei 4-Bit-Quantisierung landet es bei etwa 9.1 GB, du willst also eine 12-GB-Karte wie eine RTX 3060, um es komplett auf der GPU zu halten, und brauchst mindestens 16 GB System-RAM. Für knappere Hardware kannst du auf einen 2-Bit-Build (rund 6.3 GB) ausweichen, allerdings leidet auf dieser Stufe die Qualität.

Im Alltag fühlt es sich auf einer 12-GB-RTX 3060 flott an, mit etwa 34 tok/s bei 4-Bit, angenehm über Lesegeschwindigkeit, und eine 24-GB-RTX 4090 treibt das auf rund 94 tok/s. Auf einem Apple M Max kannst du mit etwa 38 tok/s rechnen. Das Kontextfenster liegt bei 16K, was bescheiden ist, behandle es also eher als Arbeits-Notizblock denn als Ablage für ganze Dokumente. Schon bei 8K Kontext klettert der gesamte Speicherbedarf auf rund 10.5 GB, lass auf einer 12-GB-Karte also Luft.

Im Vergleich zu seinen Geschwistern sind Phi-4 14B und Qwen 3 14B die richtige Wahl, wenn du ein allgemeines Chat-und-Reasoning-Modell willst, denn dieser Build tauscht einen Teil dieser Breite gegen Bildverständnis ein. Phi-4 Mini 3.8B ist die leichtere Option, wenn der Speicher knapp ist. Die herausragende Eigenschaft hier: Du bekommst echtes multimodales Reasoning bei einem Speicherbedarf, der noch auf eine einzelne Mittelklasse-GPU passt, und die MIT-Lizenz bedeutet, dass du dir keine Sorgen um kommerzielle Einschränkungen machen musst.

Technische Daten

Parameter15B
Kontextfenster16K Token
AnbieterMicrosoft
LizenzMIT
Veröffentlicht2026-03
Am besten fürBilderkennung, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.356.3 GB12 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.859.1 GB16 GBEmpfohlen
Q5_K_M5.6510.6 GB16 GBHoch
Q8_08.515.9 GB24 GBNahezu Original
F161630.0 GB48 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.7 GB~9.8 GB
8K Token~1.4 GB~10.5 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~94 tok/s
Apple M-series (base)100 GB/s~9 tok/s
Apple M-series Pro270 GB/s~25 tok/s
Apple M-series Max410 GB/s~38 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Häufig gestellte Fragen

Phi-4 Reasoning Vision 15B Systemanforderungen — Kann ich es lokal ausführen?