Phi-4 Reasoning Vision 15B çalıştırabilir miyim?
Microsoft imzalı Phi-4 Reasoning Vision 15B, önerilen 4-bit nicemlemede yaklaşık 16 GB RAM ister (9.1 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~34 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Phi-4 Reasoning Vision 15B, Microsoft'un genel sohbet için değil görsel anlama ve akıl yürütme için tasarladığı açık ağırlıklı (MIT lisanslı, yani ticari olarak serbestçe kullanılabilir) bir model. Yoğun (dense) 15B parametreli bir model; bu da her token üretiminde modelin tamamının belleğe yüklenip çalıştığı anlamına geliyor. 4-bit niceleme (quant) ile boyutu yaklaşık 9.1 GB'a iniyor, dolayısıyla modeli tamamen GPU üzerinde tutmak için RTX 3060 gibi 12 GB'lık bir kart istersiniz ve en az 16 GB sistem RAM gerekir. Daha sıkışık donanıma sığdırıyorsanız 2-bit sürüme (yaklaşık 6.3 GB) düşebilirsiniz, ama o seviyede kalite gözle görülür biçimde düşer.
Günlük kullanımda 12 GB'lık RTX 3060 üzerinde 4-bit'te saniyede yaklaşık 34 token ile akıcı hissettiriyor; bu okuma hızının üzerinde, rahat bir tempo. 24 GB'lık RTX 4090 bunu saniyede 94 token civarına çıkarıyor. Apple M serisi Max çiplerinde ise saniyede yaklaşık 38 token bekleyebilirsiniz. Bağlam penceresi 16K, yani mütevazı; onu tüm belgeleri içine boşaltacağınız bir yer değil, çalışma müsveddesi gibi düşünün. 8K bağlamda bile toplam bellek ayak izi yaklaşık 10.5 GB'a tırmanıyor, o yüzden 12 GB'lık bir kartta pay bırakın.
Kardeş modelleriyle kıyaslandığında, genel sohbet ve akıl yürütme isteyenler için Phi-4 14B ve Qwen 3 14B daha doğru tercih; çünkü bu sürüm o genişliğin bir kısmını görsel anlama yeteneği için takas ediyor. Bellek kısıtlıyken Phi-4 Mini 3.8B daha hafif seçenek. Buradaki öne çıkan özellik, tek bir orta seviye GPU'ya sığmaya devam eden bir ayak izinde gerçek anlamda çok kipli (multimodal) akıl yürütme elde etmeniz; ayrıca MIT lisansı sayesinde endişelenecek hiçbir ticari kısıtlama yok.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.3 GB | 12 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 9.1 GB | 16 GB | Önerilen |
| Q5_K_M | 5.65 | 10.6 GB | 16 GB | Yüksek |
| Q8_0 | 8.5 | 15.9 GB | 24 GB | Orijinale yakın |
| F16 | 16 | 30.0 GB | 48 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.7 GB | ~9.8 GB |
| 8K token | ~1.4 GB | ~10.5 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~94 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~25 tok/s |
| Apple M-series Max | 410 GB/s | ~38 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.