Gemma 4 E4B çalıştırabilir miyim?
Google imzalı Gemma 4 E4B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~112 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Gemma 4 E4B, Google'ın küçük mixture-of-experts modeli; görselleri de okuyabilen yerel bir asistan istiyorsanız iyi bir tercih. MoE'nin püf noktası şu: token başına 8B parametrenin yalnızca yaklaşık 4.5B'si çalışır, yani çok daha küçük bir modelin hızında koşar ama yine de tamamını belleğe sığdırmanız gerekir. 4-bit'te yaklaşık 4.9 GB'a oturur; bu da RTX 3060 gibi 12 GB'lık bir kartta bol bol yer kalacak şekilde sığar ve 8 GB'lık bir Apple Silicon Mac'in unified memory'sine de rahat girer. Aktif dilime değil, modelin tamamına göre yer planlayın.
Günlük kullanımda hızlı hissettiriyor. Bir RTX 3060'ta 4-bit'te saniyede yaklaşık 112 token bekleyebilirsiniz; RTX 4090 gibi üst seviye bir kart ise bunu okuyabileceğinizden çok daha hızlı, 300'ün üzerine taşıyor. Apple Silicon tarafında bir M-Max ~128 tok/s civarında oturuyor, DDR5 üzerinde salt CPU bile sabırlıysanız kabaca 19 tok/s veriyor. 128K bağlam penceresi gerçek ama pahalı: tamamını doldurursanız toplam bellek yaklaşık 21.7 GB'a tırmanır, ki bu yalnızca ağırlıkların ima ettiğinin çok ötesi. Küçük donanımda çalışma bağlamını birkaç bin token'da tutun, rahat edersiniz.
Ailenin daha hafif kardeşi Gemma 3 4B ile karşılaştırıldığında E4B, benzer şekilde küçük bir aktif ayak izini korurken genelde daha güçlü çıktı veriyor; ikisi de görsel işliyor, dolayısıyla gerçekten bellek sıkıntısı çekmediğiniz sürece daha iyi varsayılan seçim. Öne çıkan özelliği o MoE hız-kalite dengesi: küçük model gecikmesiyle sohbet ve görüntü anlama. Lisans ise işin kolay kısmı. Apache 2.0, sağlayıcıya özgü hiçbir bağlayıcı koşul olmadan, ticari kullanım ve üretim dahil özgürce kullanabileceğiniz anlamına geliyor. Bu da onu, üzerine gerçekten bir şey çıkarabileceğiniz en sade yerel modellerden biri yapıyor.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 4.9 GB | 8 GB | Önerilen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Yüksek |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Orijinale yakın |
| F16 | 16 | 16.0 GB | 24 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.5 GB | ~5.4 GB |
| 8K token | ~1.0 GB | ~5.9 GB |
| 32K token | ~4.2 GB | ~9.1 GB |
| 128K token | ~16.8 GB | ~21.7 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~112 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~314 tok/s |
| Apple M-series (base) | 100 GB/s | ~31 tok/s |
| Apple M-series Pro | 270 GB/s | ~84 tok/s |
| Apple M-series Max | 410 GB/s | ~128 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~19 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run gemma4:e4bKaynaklar ve indirme