← Tüm modellerMODEL TESTİ

Gemma 3 12B çalıştırabilir miyim?

Google imzalı Gemma 3 12B, önerilen 4-bit nicemlemede yaklaşık 12 GB RAM ister (7.4 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~41 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Gemma 3 12B, Google'ın orta boy açık ağırlıklı modeli ve alışılmış 7-8B sohbet modellerinden daha fazla yetenek isteyen ama bir iş istasyonu gerektiren bir şeye atlamak istemeyenler için gerçekten kullanışlı bir noktada duruyor. 4-bit niceleme (quant) ile yaklaşık 7.4 GB tutuyor; bu, RTX 3060 gibi 12 GB'lık bir karta biraz pay bırakarak sığıyor ve 16 GB ve üstü Apple Silicon Mac'lerde birleşik bellekte rahatça çalışıyor. Modeli yüklemenin alt sınırı 12 GB RAM. Ayrıca görselle de çalışıyor, yani metnin yanında ona resim verebilirsiniz — bu boyuttaki çoğu model bunu yapamaz.

Günlük kullanımda tüketici donanımında hızlı hissettiriyor. RTX 3060 12GB üzerinde 4-bit'te saniyede yaklaşık 41 token alıyorsunuz — okuma hızınızdan daha hızlı — ve bir Apple M Max bunu yaklaşık 47 tok/s'ye çıkarıyor. Elinizde bir 4090 varsa şıp diye yaklaşık 116 tok/s'de uçuyor. Püf noktası 128K bağlam penceresi: gerçekten orada, ama doldurmak pahalı. Tam 128K'da model artı KV cache toplamda yaklaşık 27.7 GB istiyor; bu da 12 GB'lık bir kartın tutabileceğinin çok ötesinde, dolayısıyla 24 GB'lık bir GPU'nuz ya da bol birleşik belleğiniz yoksa çalışma bağlamını mütevazı tutun.

Aynı boyuttaki belirgin alternatif Mistral Nemo 12B'ye karşı Gemma 3 12B, talimat takibi ve çok kipli (multimodal) işlerde genelde önde — çünkü Nemo yalnızca metin; yine de saf uzun bağlamlı sohbet için Nemo daha hafif seçim olma eğiliminde. Daha küçük kalmak isterseniz Gemma 3 4B kapladığı yeri düşürürken görsel yeteneğini koruyor. Gemma 3 12B'nin öne çıkan yanı, tek bir orta segment GPU'da hâlâ çalışabilen yetenekli bir görsel-ve-sohbet modeli olması. Bir uyarı: Google'ın Gemma lisansıyla geliyor; bu, açık ağırlıklı olsa da sağlayıcıya özgü şartlar içeriyor, bu yüzden düpedüz açık kaynak varsaymak yerine herhangi bir ticari dağıtımdan önce onları okuyun.

Teknik özellikler

Parametre12.2B
Bağlam penceresi128K token
SağlayıcıGoogle
LisansGemma
Çıkış2025-03
En iyi olduğu alanSohbet, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.355.1 GB8 GBBelirgin kayıp
Q4_K_MÖnerilen4.857.4 GB12 GBÖnerilen
Q5_K_M5.658.6 GB16 GBYüksek
Q8_08.513.0 GB24 GBOrijinale yakın
F161624.4 GB32 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.6 GB~8.0 GB
8K token~1.3 GB~8.7 GB
32K token~5.1 GB~12.5 GB
128K token~20.3 GB~27.7 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~41 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~116 tok/s
Apple M-series (base)100 GB/s~11 tok/s
Apple M-series Pro270 GB/s~31 tok/s
Apple M-series Max410 GB/s~47 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gemma3:12b

Sık sorulan sorular