Gemma 4 12B çalıştırabilir miyim?
Google imzalı Gemma 4 12B, önerilen 4-bit nicemlemede yaklaşık 12 GB RAM ister (7.3 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~42 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Gemma 4 12B, sohbet, kodlama ve akıl yürütme için tasarlanmış, görsel anlama yeteneğine sahip yoğun (dense) 12B'lik bir model; yani tek bir yetenekli yerel asistan isteyip aynı zamanda görsel de okumasını bekleyenlere hitap ediyor. 4-bit niceleme (quant) ile boyutu 7.3 GB civarına iniyor, dolayısıyla RTX 3060 gibi 12 GB'lik bir ekran kartına bağlam için yer kalacak şekilde sığıyor ve Apple Silicon Mac'lerin birleşik belleğinde rahatça çalışıyor. Modelin yüklenmesi için en az 12 GB RAM gerekiyor. Eliniz darsa, 2-bit sürüm yaklaşık 5 GB'a kadar düşüyor; ama bu sıkışmanın bedelini kaliteden ödüyorsunuz.
Günlük kullanımda RTX 3060'ta saniyede yaklaşık 42 tok/s hızında akıyor; bu da çıktıyı eş zamanlı okumaya yetecek kadar hızlı. M serisi Max'te ise yaklaşık 48 tok/s alıyorsunuz. RTX 4090 onu 100'ün üzerine çıkarıyor. 256K bağlam penceresi cömert, ama bunu varsayılan değil, bir tampon alanı gibi düşünün. 128K bağlamda bile model artı KV cache toplamda kabaca 27.4 GB'a tırmanıyor; bu da tek bir 12 GB'lik kartın çok ötesinde, yani ya sistem belleğine taşarsınız ya da ciddi şekilde yavaşlarsınız. Tüketici donanımında çalışma bağlamını birkaç bin token ile sınırlı tutun.
Daha hafif Gemma 3 4B ile karşılaştırıldığında 12B, çok adımlı akıl yürütme ve kodlamada genel olarak daha iyi tutunuyor; ekstra belleğin karşılığında elde ettiğiniz şey bu. Eliniz darsa ya da yalnızca sohbet ve görsel anlama lazımsa tercihiniz Gemma 3 4B olmalı. Buradaki asıl öne çıkan nokta, görsel anlama ile sağlam metin akıl yürütmesinin tek bir modelde gelmesi ve bunun hâlâ orta seviye bir GPU'da çalışabilmesi. Lisans tarafı da temiz: Apache 2.0, modeli ticari olarak ve üretimde sağlayıcıya özgü hiçbir koşula takılmadan kullanabileceğiniz anlamına geliyor.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.0 GB | 8 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 7.3 GB | 12 GB | Önerilen |
| Q5_K_M | 5.65 | 8.5 GB | 16 GB | Yüksek |
| Q8_0 | 8.5 | 12.8 GB | 24 GB | Orijinale yakın |
| F16 | 16 | 24.0 GB | 32 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.6 GB | ~7.9 GB |
| 8K token | ~1.3 GB | ~8.6 GB |
| 32K token | ~5.0 GB | ~12.3 GB |
| 128K token | ~20.1 GB | ~27.4 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~42 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~118 tok/s |
| Apple M-series (base) | 100 GB/s | ~12 tok/s |
| Apple M-series Pro | 270 GB/s | ~32 tok/s |
| Apple M-series Max | 410 GB/s | ~48 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run gemma4:12bKaynaklar ve indirme