Phi-4 Mini 3.8B çalıştırabilir miyim?
Microsoft imzalı Phi-4 Mini 3.8B, önerilen 4-bit nicemlemede yaklaşık 6 GB RAM ister (2.3 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~133 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Phi-4 Mini 3.8B, Microsoft'un küçük sohbet modeli; gerçekten hafif bir şey isteyip yine de düzgün bir konuşma yürütebilecek bir model arıyorsanız ilk uzanacağınız seçenek. 4-bit niceleme ile yaklaşık 2.3 GB'a oturuyor, 2-bit'te ise kabaca 1.6 GB'a kadar düşüyor; yani neredeyse her yere sığıyor: 6 GB'lık bir GPU'da bol bol yer kalıyor, giriş seviyesi bir M1 Mac onu hiç zorlanmadan çalıştırıyor, CPU üzerinde eski bir dizüstü bile kaldırabiliyor. MIT lisansı işin kolay tarafı; okunacak şart yok, ticari kısıtlama yok, dolayısıyla bir ürüne özgürce koyabilirsiniz.
Günlük kullanımda hızlı. Bir RTX 3060'ta yaklaşık 133 tok/s görürsünüz, M serisi bir Max 151 tok/s civarında durur, bir 4090 ise onu 370 tok/s'nin ötesine taşır ki bu, okuyabileceğinizden çok daha hızlıdır. 128K bağlam öne çıkan rakam ama ona temkinli yaklaşın: doldurursanız toplam bellek yaklaşık 14.3 GB'a tırmanır, bu da modelin boştayken ihtiyaç duyduğu 6 GB'ın çok ötesindedir. Küçük bir GPU'da çalışma bağlamını birkaç bin token'da tutun, rahat edersiniz. DDR5 üzerinde CPU bile kısa istemler için 22 tok/s civarını yakalar.
Boyutunu asıl belli ettiği yer derinlik. Akıl yürütme ve çok adımlı talimatlarda, kabaca aynı parametre sayısında olmasına rağmen genelde Qwen 3 4B üstündür; gerçek akıl yürütme alanına ihtiyacınız varsa Phi-4 14B bariz bir üst basamaktır. Phi-4 Mini'nin öne çıkan özelliği verimliliği: düz sohbet ve özetlemede 3.8B'lik boyutunun üzerinde performans verirken, neredeyse her yerde çalışacak kadar küçük kalıyor, üstelik MIT lisanslı ve kısıtlamasız. Hızlı yüklenen ve yolunuzdan çekilen ufak bir yerel asistan istiyorsanız, bu güçlü bir varsayılan.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.6 GB | 4 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 2.3 GB | 6 GB | Önerilen |
| Q5_K_M | 5.65 | 2.7 GB | 6 GB | Yüksek |
| Q8_0 | 8.5 | 4.0 GB | 8 GB | Orijinale yakın |
| F16 | 16 | 7.6 GB | 12 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.4 GB | ~2.7 GB |
| 8K token | ~0.8 GB | ~3.1 GB |
| 32K token | ~3.0 GB | ~5.3 GB |
| 128K token | ~12.0 GB | ~14.3 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~133 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~372 tok/s |
| Apple M-series (base) | 100 GB/s | ~37 tok/s |
| Apple M-series Pro | 270 GB/s | ~100 tok/s |
| Apple M-series Max | 410 GB/s | ~151 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~22 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run phi4-miniKaynaklar ve indirme
Ollama Library
Modeli tek komutla indir ve çalıştır.
ollama.comHugging Face
Model ağırlıkları, dosyalar ve lisans detayları.
huggingface.coResmi GitHub reposu
Microsoft kaynak kodu, sürümler ve issue'lar.
github.comMicrosoft — resmi sayfa
Microsoft tarafından resmi sayfa ve dokümantasyon.
azure.microsoft.com