Kann ich Phi-4 Reasoning Vision 15B lokal ausführen?
Phi-4 Reasoning Vision 15B von Microsoft benötigt bei der empfohlenen 4-Bit-Quantisierung rund 16 GB RAM (9.1 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Phi-4 Reasoning Vision 15B ist Microsofts Open-Weight-Modell (unter MIT-Lizenz, also frei kommerziell nutzbar), das auf Vision und Reasoning ausgelegt ist statt auf allgemeinen Chat. Es ist ein dichtes Modell mit 15B Parametern, das heißt das gesamte Modell wird geladen und läuft bei jedem Token mit. Bei 4-Bit-Quantisierung landet es bei etwa 9.1 GB, du willst also eine 12-GB-Karte wie eine RTX 3060, um es komplett auf der GPU zu halten, und brauchst mindestens 16 GB System-RAM. Für knappere Hardware kannst du auf einen 2-Bit-Build (rund 6.3 GB) ausweichen, allerdings leidet auf dieser Stufe die Qualität.
Im Alltag fühlt es sich auf einer 12-GB-RTX 3060 flott an, mit etwa 34 tok/s bei 4-Bit, angenehm über Lesegeschwindigkeit, und eine 24-GB-RTX 4090 treibt das auf rund 94 tok/s. Auf einem Apple M Max kannst du mit etwa 38 tok/s rechnen. Das Kontextfenster liegt bei 16K, was bescheiden ist, behandle es also eher als Arbeits-Notizblock denn als Ablage für ganze Dokumente. Schon bei 8K Kontext klettert der gesamte Speicherbedarf auf rund 10.5 GB, lass auf einer 12-GB-Karte also Luft.
Im Vergleich zu seinen Geschwistern sind Phi-4 14B und Qwen 3 14B die richtige Wahl, wenn du ein allgemeines Chat-und-Reasoning-Modell willst, denn dieser Build tauscht einen Teil dieser Breite gegen Bildverständnis ein. Phi-4 Mini 3.8B ist die leichtere Option, wenn der Speicher knapp ist. Die herausragende Eigenschaft hier: Du bekommst echtes multimodales Reasoning bei einem Speicherbedarf, der noch auf eine einzelne Mittelklasse-GPU passt, und die MIT-Lizenz bedeutet, dass du dir keine Sorgen um kommerzielle Einschränkungen machen musst.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.3 GB | 12 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 9.1 GB | 16 GB | Empfohlen |
| Q5_K_M | 5.65 | 10.6 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 15.9 GB | 24 GB | Nahezu Original |
| F16 | 16 | 30.0 GB | 48 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.7 GB | ~9.8 GB |
| 8K Token | ~1.4 GB | ~10.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~94 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~25 tok/s |
| Apple M-series Max | 410 GB/s | ~38 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.