← Tüm modellerMODEL TESTİ

Gemma 4 12B çalıştırabilir miyim?

Google imzalı Gemma 4 12B, önerilen 4-bit nicemlemede yaklaşık 12 GB RAM ister (7.3 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~42 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Gemma 4 12B, sohbet, kodlama ve akıl yürütme için tasarlanmış, görsel anlama yeteneğine sahip yoğun (dense) 12B'lik bir model; yani tek bir yetenekli yerel asistan isteyip aynı zamanda görsel de okumasını bekleyenlere hitap ediyor. 4-bit niceleme (quant) ile boyutu 7.3 GB civarına iniyor, dolayısıyla RTX 3060 gibi 12 GB'lik bir ekran kartına bağlam için yer kalacak şekilde sığıyor ve Apple Silicon Mac'lerin birleşik belleğinde rahatça çalışıyor. Modelin yüklenmesi için en az 12 GB RAM gerekiyor. Eliniz darsa, 2-bit sürüm yaklaşık 5 GB'a kadar düşüyor; ama bu sıkışmanın bedelini kaliteden ödüyorsunuz.

Günlük kullanımda RTX 3060'ta saniyede yaklaşık 42 tok/s hızında akıyor; bu da çıktıyı eş zamanlı okumaya yetecek kadar hızlı. M serisi Max'te ise yaklaşık 48 tok/s alıyorsunuz. RTX 4090 onu 100'ün üzerine çıkarıyor. 256K bağlam penceresi cömert, ama bunu varsayılan değil, bir tampon alanı gibi düşünün. 128K bağlamda bile model artı KV cache toplamda kabaca 27.4 GB'a tırmanıyor; bu da tek bir 12 GB'lik kartın çok ötesinde, yani ya sistem belleğine taşarsınız ya da ciddi şekilde yavaşlarsınız. Tüketici donanımında çalışma bağlamını birkaç bin token ile sınırlı tutun.

Daha hafif Gemma 3 4B ile karşılaştırıldığında 12B, çok adımlı akıl yürütme ve kodlamada genel olarak daha iyi tutunuyor; ekstra belleğin karşılığında elde ettiğiniz şey bu. Eliniz darsa ya da yalnızca sohbet ve görsel anlama lazımsa tercihiniz Gemma 3 4B olmalı. Buradaki asıl öne çıkan nokta, görsel anlama ile sağlam metin akıl yürütmesinin tek bir modelde gelmesi ve bunun hâlâ orta seviye bir GPU'da çalışabilmesi. Lisans tarafı da temiz: Apache 2.0, modeli ticari olarak ve üretimde sağlayıcıya özgü hiçbir koşula takılmadan kullanabileceğiniz anlamına geliyor.

Teknik özellikler

Parametre12B
Bağlam penceresi256K token
SağlayıcıGoogle
LisansApache 2.0
Çıkış2026-04
En iyi olduğu alanSohbet, Kodlama, Akıl yürütme, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.355.0 GB8 GBBelirgin kayıp
Q4_K_MÖnerilen4.857.3 GB12 GBÖnerilen
Q5_K_M5.658.5 GB16 GBYüksek
Q8_08.512.8 GB24 GBOrijinale yakın
F161624.0 GB32 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.6 GB~7.9 GB
8K token~1.3 GB~8.6 GB
32K token~5.0 GB~12.3 GB
128K token~20.1 GB~27.4 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~42 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~118 tok/s
Apple M-series (base)100 GB/s~12 tok/s
Apple M-series Pro270 GB/s~32 tok/s
Apple M-series Max410 GB/s~48 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gemma4:12b

Sık sorulan sorular