← Tüm modellerMODEL TESTİ

Gemma 4 E4B çalıştırabilir miyim?

Google imzalı Gemma 4 E4B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~112 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Gemma 4 E4B, Google'ın küçük mixture-of-experts modeli; görselleri de okuyabilen yerel bir asistan istiyorsanız iyi bir tercih. MoE'nin püf noktası şu: token başına 8B parametrenin yalnızca yaklaşık 4.5B'si çalışır, yani çok daha küçük bir modelin hızında koşar ama yine de tamamını belleğe sığdırmanız gerekir. 4-bit'te yaklaşık 4.9 GB'a oturur; bu da RTX 3060 gibi 12 GB'lık bir kartta bol bol yer kalacak şekilde sığar ve 8 GB'lık bir Apple Silicon Mac'in unified memory'sine de rahat girer. Aktif dilime değil, modelin tamamına göre yer planlayın.

Günlük kullanımda hızlı hissettiriyor. Bir RTX 3060'ta 4-bit'te saniyede yaklaşık 112 token bekleyebilirsiniz; RTX 4090 gibi üst seviye bir kart ise bunu okuyabileceğinizden çok daha hızlı, 300'ün üzerine taşıyor. Apple Silicon tarafında bir M-Max ~128 tok/s civarında oturuyor, DDR5 üzerinde salt CPU bile sabırlıysanız kabaca 19 tok/s veriyor. 128K bağlam penceresi gerçek ama pahalı: tamamını doldurursanız toplam bellek yaklaşık 21.7 GB'a tırmanır, ki bu yalnızca ağırlıkların ima ettiğinin çok ötesi. Küçük donanımda çalışma bağlamını birkaç bin token'da tutun, rahat edersiniz.

Ailenin daha hafif kardeşi Gemma 3 4B ile karşılaştırıldığında E4B, benzer şekilde küçük bir aktif ayak izini korurken genelde daha güçlü çıktı veriyor; ikisi de görsel işliyor, dolayısıyla gerçekten bellek sıkıntısı çekmediğiniz sürece daha iyi varsayılan seçim. Öne çıkan özelliği o MoE hız-kalite dengesi: küçük model gecikmesiyle sohbet ve görüntü anlama. Lisans ise işin kolay kısmı. Apache 2.0, sağlayıcıya özgü hiçbir bağlayıcı koşul olmadan, ticari kullanım ve üretim dahil özgürce kullanabileceğiniz anlamına geliyor. Bu da onu, üzerine gerçekten bir şey çıkarabileceğiniz en sade yerel modellerden biri yapıyor.

Teknik özellikler

Parametre8B (4.5B aktif)
Bağlam penceresi128K token
SağlayıcıGoogle
LisansApache 2.0
Çıkış2026-04
En iyi olduğu alanSohbet, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.353.4 GB6 GBBelirgin kayıp
Q4_K_MÖnerilen4.854.9 GB8 GBÖnerilen
Q5_K_M5.655.7 GB12 GBYüksek
Q8_08.58.5 GB16 GBOrijinale yakın
F161616.0 GB24 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.5 GB~5.4 GB
8K token~1.0 GB~5.9 GB
32K token~4.2 GB~9.1 GB
128K token~16.8 GB~21.7 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~112 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~314 tok/s
Apple M-series (base)100 GB/s~31 tok/s
Apple M-series Pro270 GB/s~84 tok/s
Apple M-series Max410 GB/s~128 tok/s
CPU only (dual-channel DDR5)60 GB/s~19 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gemma4:e4b

Sık sorulan sorular

Gemma 4 E4B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?