Gemma 3n E4B çalıştırabilir miyim?
Google imzalı Gemma 3n E4B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.7 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~126 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Gemma 3n E4B, Google'ın sohbet ve görüntü işleme için geliştirdiği küçük çok kipli (multimodal) modeli; doğrudan yetenekli bir yerel asistan isteyen, üstelik görselleri de yorumlayabilen kişileri hedefliyor. Kağıt üzerinde 7.8B parametre taşıyor ama mixture-of-experts (uzman karışımı) bir tasarım: token başına yalnızca yaklaşık 4B parametre devreye giriyor, bu yüzden tam boyutunun düşündürdüğünden gözle görülür biçimde hızlı çalışıyor. 4-bit'te yaklaşık 4.7 GB'a iniyor; bu da RTX 3060 gibi 8 GB'lık bir GPU'ya rahatça sığıyor ve yeni nesil herhangi bir Apple Silicon Mac'in birleşik belleğine sorunsuz oturuyor. MoE'nin püf noktası şu: ne kadar az uzman ateşlenirse ateşlensin, modelin tamamını bellekte tutman gerekiyor, dolayısıyla en az 8 GB RAM planla.
Günlük kullanımda hızlı hissettiriyor. RTX 3060 12GB üzerinde 4-bit'te saniyede yaklaşık 126 token bekleyebilirsin, bir 4090 bunu kabaca 353'e çıkarıyor; ikisi de okuma hızının çok ötesinde. M serisi bir Max yaklaşık 144 civarında, DDR5 üzerinde saf CPU bile yaklaşık 21 token/s yönetiyor; acelen yoksa kullanılabilir. Görüntü tarafı ise bu boyuttaki yalnızca metin işleyen bir modele tercih etmenin asıl sebebi. Bağlam (context) en fazla 32K'da tavan yapıyor; sohbet ve doküman soru-cevabı için rahat, ama uzun bağlamlı bir iş atı değil. O pencereyi doldurduğunda toplam bellek kabaca 8.8 GB'a tırmanıyor, bu yüzden 8 GB'lık bir kartta çalışma bağlamını ölçülü tut.
Sınıfındaki bariz yalnızca metin işleyen alternatif olan Llama 3.1 8B karşısında Gemma 3n E4B, genel olarak biraz ham akıl yürütme derinliğinden feragat edip karşılığında Llama'nın bu bellek ayak izinde sunamayacağı iki şey kazanıyor: yerel (native) görüntü anlama ve MoE hız avantajı. Yalnızca metin gerekiyorsa Gemma 3 4B daha hafif kardeşi, Llama 3.1 8B ise saf sohbet için daha güvenli seçim. Gemma 3n E4B'nin öne çıkan yanı, hâlâ 8 GB'a sığarken gerçekten kullanılabilir bir görüntü-ve-sohbet modeli olması. Lisans konusunda bir not: Gemma lisansı açık kaynak değil, açık ağırlıklı (open-weight); Google'ın kendi kullanım şartlarıyla geliyor, bu yüzden ürünleştirmeden önce bunları oku — ticari kullanıma izin verilse de.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.3 GB | 6 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 4.7 GB | 8 GB | Önerilen |
| Q5_K_M | 5.65 | 5.5 GB | 12 GB | Yüksek |
| Q8_0 | 8.5 | 8.3 GB | 12 GB | Orijinale yakın |
| F16 | 16 | 15.6 GB | 24 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.5 GB | ~5.2 GB |
| 8K token | ~1.0 GB | ~5.7 GB |
| 32K token | ~4.1 GB | ~8.8 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run gemma3nKaynaklar ve indirme