← Tüm modellerMODEL TESTİ

Phi-4 14B çalıştırabilir miyim?

Microsoft imzalı Phi-4 14B, önerilen 4-bit nicemlemede yaklaşık 16 GB RAM ister (8.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~34 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Phi-4 14B, Microsoft'un küçük akıl yürütme modeli; tipik bir 7-8B sohbet modelinden daha güçlü mantık ve yapılandırılmış düşünme isteyen ama bunun için bir iş istasyonuna geçmek istemeyenlere yönelik. 14.7B parametreyle 4-bit niceleme altında yaklaşık 8.9 GB'a oturuyor, dolayısıyla rahat bir alan payıyla düz bir 8 GB karta sığmıyor; 16 GB minimum RAM rakamı dürüst alt sınır. 12 GB'lık bir RTX 3060, 16 GB'lık bir Apple Silicon Mac ya da 9 GB üzerinde alanı olan herhangi bir GPU bu modelin doğal evi. Sadece gerçekten sıkıştıysanız 6.2 GB civarındaki 2-bit yapıya inin.

Günlük kullanımda hızlı olmaktan çok ölçülü hissettiriyor, ki bu da akıl yürütme yönelimine yakışıyor. 12 GB'lık bir RTX 3060'ta 4-bit'te saniyede yaklaşık 34 token bekleyin; sohbet ve adım adım problemler için rahat bir hız. Bir RTX 4090 bunu kabaca 96'ya çıkarıyor, M serisi bir Max ise 39 civarında kalıyor. Asıl kısıt burada bağlam penceresi: 16K, bugünkü standartlara göre mütevazı ve 8K'yı doldurmak bile toplam belleği yaklaşık 10.3 GB'a itiyor. Çalışma bağlamını yalın tutarsanız 12 GB'lık bir kartın içinde rahatça kalırsınız.

Neredeyse aynı boyutta ve aynı sohbet-ve-akıl-yürütme odağına sahip Qwen 3 14B ile karşılaştırıldığında Phi-4, geniş dünya bilgisini genellikle Microsoft'un onu ayarladığı türden matematik ve mantık istemlerinde sıkı, iyi yapılandırılmış akıl yürütmeyle takas ediyor; Qwen ise açık uçlu görevlerde daha çok yönlü hissettiriyor. Daha hafif bir şey isterseniz Phi-4 Mini 3.8B aynı ailenin çok daha küçük ayak izli üyesi. Phi-4'ün öne çıkan özelliği, yapılandırılmış akıl yürütmede parametre sayısının üstünde performans göstermesi; MIT lisansı da işin kolay tarafı: serbestçe kullanılabilir, ticari iş dahil, sağlayıcı tarafından dayatılan hiçbir koşul yok.

Teknik özellikler

Parametre14.7B
Bağlam penceresi16K token
SağlayıcıMicrosoft
LisansMIT
Çıkış2024-12
En iyi olduğu alanSohbet, Akıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.356.2 GB12 GBBelirgin kayıp
Q4_K_MÖnerilen4.858.9 GB16 GBÖnerilen
Q5_K_M5.6510.4 GB16 GBYüksek
Q8_08.515.6 GB24 GBOrijinale yakın
F161629.4 GB48 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.7 GB~9.6 GB
8K token~1.4 GB~10.3 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~96 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run phi4

Sık sorulan sorular