Llama 3.2 3B çalıştırabilir miyim?
Meta imzalı Llama 3.2 3B, önerilen 4-bit nicemlemede yaklaşık 4 GB RAM ister (1.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~158 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Llama 3.2 3B, neredeyse hiç zorlanmayan donanımlarda gerçek bir asistan isteyenlerin tercih edeceği model. 4-bit quant ile yaklaşık 1.9 GB yer kaplıyor ve yalnızca 4 GB civarı RAM istiyor; yani pratikte her yere sığıyor: giriş seviyesi bir dizüstü, yeterli belleği olan Raspberry sınıfı bir kart, eski bir 6 GB GPU ya da biraz boş alanı olan herhangi bir Apple Silicon Mac. 8B ailesi makinenize ağır geliyorsa, sohbeti gerçekten kullanışlı tutan bir alt basamak budur.
Günlük kullanımda öne çıkan şey hız. Bir RTX 3060 üzerinde saniyede yaklaşık 158 token bekleyebilirsiniz; bir 4090 bunu ~442 tok/s seviyesine çıkarıyor ki bu okuyabileceğinizden çok daha hızlı. GPU'nuz hiç yoksa bile bir DDR5 CPU yaklaşık 26 tok/s civarını idare ediyor. 128K bağlam penceresi listelenmiş, ama bellek konusunda gerçekçi olun: bunu sonuna kadar doldurmak toplam kullanımı yaklaşık 13 GB'a tırmandırıyor; bu da modelin boştaki ayak izinin epey üzerinde. Küçük makinelerde çalışma bağlamını birkaç bin token ile sınırlı tutun.
Kendi ailesi içinde Llama 3.2 3B, derinlikten ödün vererek boyut kazanıyor. Llama 3.1 8B genelde daha zor akıl yürütmeyi ve çok adımlı yönergeleri daha iyi kotarır; 1B kardeşi ise yalnızca gerçekten bellek darboğazındaysanız ve daha zayıf yanıtları kabul edebiliyorsanız mantıklı. 3B'nin asıl özelliği, oyuncak gibi değil de yetkin bir sohbet partneri gibi hissettiren en küçük Llama olması. Bir uyarı: Llama Community lisansıyla geliyor; bu, ağırlıkları açık (open-weight) olsa da Meta'nın kendi şartlarını taşıyor, yani düz anlamıyla open-source değil. Üzerine ürün geliştirmeden önce bu şartları inceleyin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.3 GB | 4 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 1.9 GB | 4 GB | Önerilen |
| Q5_K_M | 5.65 | 2.3 GB | 6 GB | Yüksek |
| Q8_0 | 8.5 | 3.4 GB | 6 GB | Orijinale yakın |
| F16 | 16 | 6.4 GB | 12 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.3 GB | ~2.2 GB |
| 8K token | ~0.7 GB | ~2.6 GB |
| 32K token | ~2.8 GB | ~4.7 GB |
| 128K token | ~11.1 GB | ~13.0 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~158 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~442 tok/s |
| Apple M-series (base) | 100 GB/s | ~44 tok/s |
| Apple M-series Pro | 270 GB/s | ~118 tok/s |
| Apple M-series Max | 410 GB/s | ~180 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~26 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run llama3.2