Llama 4 Scout çalıştırabilir miyim?
Meta imzalı Llama 4 Scout, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (66.1 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~34 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Llama 4 Scout, Meta'nın mixture-of-experts (uzman karışımı) modeli ve anlaşılması gereken en kritik nokta iki boyutu arasındaki fark. Toplam 109B parametresi var ama token başına bunların yalnızca 17B'sini yönlendiriyor; yani 17B'lik bir model hızında üretim yapıyor, buna karşılık tam 109B'lik modelin belleğini talep ediyor. 4-bit quant ile diskte yaklaşık 66 GB tutuyor ve yüklemek için en az 96 GB RAM veya unified memory gerekiyor. Bu 24 GB'lık bir tüketici GPU'su modeli değil: ne RTX 3060 ne de RTX 4090 bu modeli sığdırabiliyor. Gerçekçi olmak gerekirse bu, bir iş istasyonu ya da sonuna kadar donatılmış bir Apple Silicon makine işi.
Yeterli unified memory'ye sahip bir Apple M Max üzerinde 4-bit ile saniyede yaklaşık 34 token üretiyor; bu, okuma hızınızdan rahatça daha hızlı ve etkileşimli sohbet ile vision (görsel) görevleri için fazlasıyla yeterli. DDR5 ile CPU üzerinde ise saniyede kabaca 5 token'a düşüyorsunuz; toplu işler için kullanılabilir ama karşılıklı yazışma için sinir bozucu. Reklam edilen context devasa, ancak dikkatli olun: 128K token'a doğru zorlamak toplam belleği yaklaşık 120 GB'a çıkarıyor, yani uzun context bedava bir ayar değil, bir donanım-bütçesi kararı. Bol bol yeriniz yoksa çalışma context'ini ölçülü tutun.
Bu sınıftaki diğer büyük model olan GPT-OSS 120B ile kıyaslandığında, vision desteklediği için multimodal tercih Scout oluyor; GPT-OSS ise saf akıl yürütmede genelde önde. Llama 3.2 3B gibi küçük kardeşleriyle kıyaslandığında Scout tamamen farklı bir taahhüt: onlar telefon sınıfı bir iz alanında çalışırken bu bir sunucu istiyor. Öne çıkan özelliği, bu ölçekte gerçekten hızlı ve görsel işleyebilen bir model olması. Bir uyarı: Llama Community lisansı altında geliyor; bu lisans open-source değil open-weight (açık ağırlık) niteliğinde, dolayısıyla üzerine ticari bir şey inşa etmeden önce şartları kontrol edin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 45.6 GB | 64 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 66.1 GB | 96 GB | Önerilen |
| Q5_K_M | 5.65 | 77.0 GB | 128 GB | Yüksek |
| Q8_0 | 8.5 | 115.8 GB | 192 GB | Orijinale yakın |
| F16 | 16 | 218.0 GB | 256 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.7 GB | ~67.8 GB |
| 8K token | ~3.4 GB | ~69.5 GB |
| 32K token | ~13.6 GB | ~79.7 GB |
| 128K token | ~54.3 GB | ~120.4 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | VRAM'e sığmaz |
| Apple M-series (base) | 100 GB/s | ~8 tok/s |
| Apple M-series Pro | 270 GB/s | ~22 tok/s |
| Apple M-series Max | 410 GB/s | ~34 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~5 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run llama4:scout