Gemma 3 1B çalıştırabilir miyim?
Google imzalı Gemma 3 1B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (0.6 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~505 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Gemma 3 1B, Google'ın ufak bir sohbet modeli; anında yüklenen ve neredeyse her yerde çalışan yerel bir asistan istediğiniz senaryolar için tasarlandı. 4-bit niceleme (quant) ile boyutu yalnızca 0.6 GB civarında; 8-bit yapısı bile kabaca 1.1 GB, yani 3 GB RAM'e rahatça sığar. Bu da onun eski bir dizüstünde, Raspberry Pi sınıfı bir cihazda veya telefon seviyesi bir çipte, ayrı bir GPU'ya hiç ihtiyaç duymadan çalışabileceği anlamına gelir. Hızlı sohbet, taslak çıkarma ya da her megabaytın önemli olduğu bir uygulamaya gömme gibi işler için aradığınız model budur.
Günlük kullanımda asıl konu ham hız. Bir RTX 4090 üzerinde saniyede yaklaşık 1413 token üretiyor; daha tipik bir RTX 3060 hâlâ ~505 tok/s, Apple M Max ise ~575 tok/s civarında. DDR5 üzerinde saf CPU bile kabaca 84 tok/s'ye ulaşıyor; yani okuyabileceğinizden daha hızlı. Bağlam penceresi 32K ve büyük modellerin aksine bunun iyi bir kısmını ucuza doldurabilirsiniz: tam 32K'da her şey toplamda 2.2 GB civarında oturuyor, dolayısıyla burada sizi durduran şey asla bellek olmuyor.
Boyutu konusunda dürüst olmak gerek: 1B parametreyle bu bir akıl yürütme ya da kodlama modeli değil ve uzun, çok adımlı talimatlarda kopacaktır. Yeterince yeriniz varsa Gemma 3 4B genelde daha zorlu istemleri daha iyi kaldırır ve görüntü desteği ekler; düz sohbette karşılaştırmak için aynı ağırlık sınıfındaki bariz alternatif ise Llama 3.2 1B. Gemma 3 1B'nin öne çıkan özelliği, çalıştırabileceğiniz gerçekten kullanılabilir en küçük sohbet modeline yakın olması. Bir uyarı: Google'ın Gemma lisansıyla geliyor; bu lisans açık ağırlıklı (open-weight) olsa da sağlayıcıya özgü şartlar taşıyor, o yüzden ticari olarak yayınlamadan önce mutlaka okuyun.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.4 GB | 2 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 0.6 GB | 3 GB | Önerilen |
| Q5_K_M | 5.65 | 0.7 GB | 3 GB | Yüksek |
| Q8_0 | 8.5 | 1.1 GB | 3 GB | Orijinale yakın |
| F16 | 16 | 2.0 GB | 4 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.2 GB | ~0.8 GB |
| 8K token | ~0.4 GB | ~1.0 GB |
| 32K token | ~1.6 GB | ~2.2 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~505 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~1413 tok/s |
| Apple M-series (base) | 100 GB/s | ~140 tok/s |
| Apple M-series Pro | 270 GB/s | ~379 tok/s |
| Apple M-series Max | 410 GB/s | ~575 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~84 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run gemma3:1bKaynaklar ve indirme