← Tüm modellerMODEL TESTİ

Gemma 3n E4B çalıştırabilir miyim?

Google imzalı Gemma 3n E4B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.7 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~126 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Gemma 3n E4B, Google'ın sohbet ve görüntü işleme için geliştirdiği küçük çok kipli (multimodal) modeli; doğrudan yetenekli bir yerel asistan isteyen, üstelik görselleri de yorumlayabilen kişileri hedefliyor. Kağıt üzerinde 7.8B parametre taşıyor ama mixture-of-experts (uzman karışımı) bir tasarım: token başına yalnızca yaklaşık 4B parametre devreye giriyor, bu yüzden tam boyutunun düşündürdüğünden gözle görülür biçimde hızlı çalışıyor. 4-bit'te yaklaşık 4.7 GB'a iniyor; bu da RTX 3060 gibi 8 GB'lık bir GPU'ya rahatça sığıyor ve yeni nesil herhangi bir Apple Silicon Mac'in birleşik belleğine sorunsuz oturuyor. MoE'nin püf noktası şu: ne kadar az uzman ateşlenirse ateşlensin, modelin tamamını bellekte tutman gerekiyor, dolayısıyla en az 8 GB RAM planla.

Günlük kullanımda hızlı hissettiriyor. RTX 3060 12GB üzerinde 4-bit'te saniyede yaklaşık 126 token bekleyebilirsin, bir 4090 bunu kabaca 353'e çıkarıyor; ikisi de okuma hızının çok ötesinde. M serisi bir Max yaklaşık 144 civarında, DDR5 üzerinde saf CPU bile yaklaşık 21 token/s yönetiyor; acelen yoksa kullanılabilir. Görüntü tarafı ise bu boyuttaki yalnızca metin işleyen bir modele tercih etmenin asıl sebebi. Bağlam (context) en fazla 32K'da tavan yapıyor; sohbet ve doküman soru-cevabı için rahat, ama uzun bağlamlı bir iş atı değil. O pencereyi doldurduğunda toplam bellek kabaca 8.8 GB'a tırmanıyor, bu yüzden 8 GB'lık bir kartta çalışma bağlamını ölçülü tut.

Sınıfındaki bariz yalnızca metin işleyen alternatif olan Llama 3.1 8B karşısında Gemma 3n E4B, genel olarak biraz ham akıl yürütme derinliğinden feragat edip karşılığında Llama'nın bu bellek ayak izinde sunamayacağı iki şey kazanıyor: yerel (native) görüntü anlama ve MoE hız avantajı. Yalnızca metin gerekiyorsa Gemma 3 4B daha hafif kardeşi, Llama 3.1 8B ise saf sohbet için daha güvenli seçim. Gemma 3n E4B'nin öne çıkan yanı, hâlâ 8 GB'a sığarken gerçekten kullanılabilir bir görüntü-ve-sohbet modeli olması. Lisans konusunda bir not: Gemma lisansı açık kaynak değil, açık ağırlıklı (open-weight); Google'ın kendi kullanım şartlarıyla geliyor, bu yüzden ürünleştirmeden önce bunları oku — ticari kullanıma izin verilse de.

Teknik özellikler

Parametre7.8B (4B aktif)
Bağlam penceresi32K token
SağlayıcıGoogle
LisansGemma
Çıkış2025-06
En iyi olduğu alanSohbet, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.353.3 GB6 GBBelirgin kayıp
Q4_K_MÖnerilen4.854.7 GB8 GBÖnerilen
Q5_K_M5.655.5 GB12 GBYüksek
Q8_08.58.3 GB12 GBOrijinale yakın
F161615.6 GB24 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.5 GB~5.2 GB
8K token~1.0 GB~5.7 GB
32K token~4.1 GB~8.8 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~126 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~353 tok/s
Apple M-series (base)100 GB/s~35 tok/s
Apple M-series Pro270 GB/s~95 tok/s
Apple M-series Max410 GB/s~144 tok/s
CPU only (dual-channel DDR5)60 GB/s~21 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gemma3n

Sık sorulan sorular

Gemma 3n E4B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?