← Tüm modellerMODEL TESTİ

Llama 4 Scout çalıştırabilir miyim?

Meta imzalı Llama 4 Scout, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (66.1 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~34 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Llama 4 Scout, Meta'nın mixture-of-experts (uzman karışımı) modeli ve anlaşılması gereken en kritik nokta iki boyutu arasındaki fark. Toplam 109B parametresi var ama token başına bunların yalnızca 17B'sini yönlendiriyor; yani 17B'lik bir model hızında üretim yapıyor, buna karşılık tam 109B'lik modelin belleğini talep ediyor. 4-bit quant ile diskte yaklaşık 66 GB tutuyor ve yüklemek için en az 96 GB RAM veya unified memory gerekiyor. Bu 24 GB'lık bir tüketici GPU'su modeli değil: ne RTX 3060 ne de RTX 4090 bu modeli sığdırabiliyor. Gerçekçi olmak gerekirse bu, bir iş istasyonu ya da sonuna kadar donatılmış bir Apple Silicon makine işi.

Yeterli unified memory'ye sahip bir Apple M Max üzerinde 4-bit ile saniyede yaklaşık 34 token üretiyor; bu, okuma hızınızdan rahatça daha hızlı ve etkileşimli sohbet ile vision (görsel) görevleri için fazlasıyla yeterli. DDR5 ile CPU üzerinde ise saniyede kabaca 5 token'a düşüyorsunuz; toplu işler için kullanılabilir ama karşılıklı yazışma için sinir bozucu. Reklam edilen context devasa, ancak dikkatli olun: 128K token'a doğru zorlamak toplam belleği yaklaşık 120 GB'a çıkarıyor, yani uzun context bedava bir ayar değil, bir donanım-bütçesi kararı. Bol bol yeriniz yoksa çalışma context'ini ölçülü tutun.

Bu sınıftaki diğer büyük model olan GPT-OSS 120B ile kıyaslandığında, vision desteklediği için multimodal tercih Scout oluyor; GPT-OSS ise saf akıl yürütmede genelde önde. Llama 3.2 3B gibi küçük kardeşleriyle kıyaslandığında Scout tamamen farklı bir taahhüt: onlar telefon sınıfı bir iz alanında çalışırken bu bir sunucu istiyor. Öne çıkan özelliği, bu ölçekte gerçekten hızlı ve görsel işleyebilen bir model olması. Bir uyarı: Llama Community lisansı altında geliyor; bu lisans open-source değil open-weight (açık ağırlık) niteliğinde, dolayısıyla üzerine ticari bir şey inşa etmeden önce şartları kontrol edin.

Teknik özellikler

Parametre109B (17B aktif)
Bağlam penceresi10M token
SağlayıcıMeta
LisansLlama Community
Çıkış2025-04
En iyi olduğu alanSohbet, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3545.6 GB64 GBBelirgin kayıp
Q4_K_MÖnerilen4.8566.1 GB96 GBÖnerilen
Q5_K_M5.6577.0 GB128 GBYüksek
Q8_08.5115.8 GB192 GBOrijinale yakın
F1616218.0 GB256 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.7 GB~67.8 GB
8K token~3.4 GB~69.5 GB
32K token~13.6 GB~79.7 GB
128K token~54.3 GB~120.4 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/sVRAM'e sığmaz
Apple M-series (base)100 GB/s~8 tok/s
Apple M-series Pro270 GB/s~22 tok/s
Apple M-series Max410 GB/s~34 tok/s
CPU only (dual-channel DDR5)60 GB/s~5 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run llama4:scout

Sık sorulan sorular