← Tüm modellerMODEL TESTİ

Gemma 3 1B çalıştırabilir miyim?

Google imzalı Gemma 3 1B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (0.6 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~505 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Gemma 3 1B, Google'ın ufak bir sohbet modeli; anında yüklenen ve neredeyse her yerde çalışan yerel bir asistan istediğiniz senaryolar için tasarlandı. 4-bit niceleme (quant) ile boyutu yalnızca 0.6 GB civarında; 8-bit yapısı bile kabaca 1.1 GB, yani 3 GB RAM'e rahatça sığar. Bu da onun eski bir dizüstünde, Raspberry Pi sınıfı bir cihazda veya telefon seviyesi bir çipte, ayrı bir GPU'ya hiç ihtiyaç duymadan çalışabileceği anlamına gelir. Hızlı sohbet, taslak çıkarma ya da her megabaytın önemli olduğu bir uygulamaya gömme gibi işler için aradığınız model budur.

Günlük kullanımda asıl konu ham hız. Bir RTX 4090 üzerinde saniyede yaklaşık 1413 token üretiyor; daha tipik bir RTX 3060 hâlâ ~505 tok/s, Apple M Max ise ~575 tok/s civarında. DDR5 üzerinde saf CPU bile kabaca 84 tok/s'ye ulaşıyor; yani okuyabileceğinizden daha hızlı. Bağlam penceresi 32K ve büyük modellerin aksine bunun iyi bir kısmını ucuza doldurabilirsiniz: tam 32K'da her şey toplamda 2.2 GB civarında oturuyor, dolayısıyla burada sizi durduran şey asla bellek olmuyor.

Boyutu konusunda dürüst olmak gerek: 1B parametreyle bu bir akıl yürütme ya da kodlama modeli değil ve uzun, çok adımlı talimatlarda kopacaktır. Yeterince yeriniz varsa Gemma 3 4B genelde daha zorlu istemleri daha iyi kaldırır ve görüntü desteği ekler; düz sohbette karşılaştırmak için aynı ağırlık sınıfındaki bariz alternatif ise Llama 3.2 1B. Gemma 3 1B'nin öne çıkan özelliği, çalıştırabileceğiniz gerçekten kullanılabilir en küçük sohbet modeline yakın olması. Bir uyarı: Google'ın Gemma lisansıyla geliyor; bu lisans açık ağırlıklı (open-weight) olsa da sağlayıcıya özgü şartlar taşıyor, o yüzden ticari olarak yayınlamadan önce mutlaka okuyun.

Teknik özellikler

Parametre1B
Bağlam penceresi32K token
SağlayıcıGoogle
LisansGemma
Çıkış2025-03
En iyi olduğu alanSohbet

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.350.4 GB2 GBBelirgin kayıp
Q4_K_MÖnerilen4.850.6 GB3 GBÖnerilen
Q5_K_M5.650.7 GB3 GBYüksek
Q8_08.51.1 GB3 GBOrijinale yakın
F16162.0 GB4 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.2 GB~0.8 GB
8K token~0.4 GB~1.0 GB
32K token~1.6 GB~2.2 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~505 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~1413 tok/s
Apple M-series (base)100 GB/s~140 tok/s
Apple M-series Pro270 GB/s~379 tok/s
Apple M-series Max410 GB/s~575 tok/s
CPU only (dual-channel DDR5)60 GB/s~84 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gemma3:1b

Sık sorulan sorular