Nemotron 3 Nano 30B-A3B çalıştırabilir miyim?
NVIDIA imzalı Nemotron 3 Nano 30B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.2 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~160 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Nemotron 3 Nano, NVIDIA'nın mixture-of-experts (MoE) modeli; yoğun (dense) model maliyetlerini ödemeden yerel makinede güçlü sohbet, akıl yürütme ve kodlama isteyenler için tasarlanmış. Hilesi adında gizli: toplam 31.6B parametre taşıyor ama her token için bunların yalnızca 3.6B kadarını çalıştırıyor, yani çok küçük bir modelin hızında üretirken çok daha büyük bir modelin aklıyla düşünüyor. Her MoE'ye yeni başlayanın zor yoldan öğrendiği detay şu: yine de modelin tamamını belleğe yüklemeniz gerekiyor. 4-bit niceleme (quant) ile bu kabaca 19 GB ağırlık demek ve en az 32 GB RAM istersiniz; bu da RTX 3060 gibi 12 GB'lık bir kartı tamamen devre dışı bırakıyor.
Günlük kullanımda aktif parametre hilesi kendini gerçekten gösteriyor. RTX 4090 üzerinde saniyede yaklaşık 393 token akıtıyor ki bu kadar yetenekli bir model için bu absürt derecede hızlı; Apple Silicon M Max bile unified memory üzerinde 160 tok/s civarında oturuyor. DDR5 ile yalnızca CPU'da bu rakam yaklaşık 23 tok/s'ye düşüyor; toplu işler için kullanışlı ama interaktif sohbet için değil. Öne çıkan özellik 1,000K bağlam penceresi, ama bunu bir reklam panosu rakamı olarak görün: yalnızca 128K bağlamda toplam bellek ayak izi yaklaşık 50 GB'a tırmanıyor, yani 32 GB'lık bir makinede gerçekçi olarak bir milyon değil, birkaç on bin token ile çalışıyorsunuz.
Rakipleriyle kıyaslandığında, görüntü (vision) gerekiyorsa Gemma 4 31B daha esnek bir tercih çünkü Nemotron 3 Nano yalnızca metin destekliyor; MoE'nin bellek tuhaflıklarıyla uğraşmak istemezseniz Granite 4.0 H Small benzer boyutta yoğun (dense) bir alternatif. Nemotron'un en iyi yaptığı şey kalite başına verim: bu boyut sınıfında çok adımlı akıl yürütmeyi hâlâ kaldırırken bu kadar hızlı üreten başka bir model yok. Üzerine bir şey inşa etmeden önce bir uyarı: NVIDIA Open Model lisansı açık ağırlıklı (open-weight), gerçek anlamda açık kaynak değil; bu yüzden ticari kullanım için Apache tarzı bir özgürlük varsaymak yerine şartları dikkatlice okuyun.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.2 GB | 24 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 19.2 GB | 32 GB | Önerilen |
| Q5_K_M | 5.65 | 22.3 GB | 32 GB | Yüksek |
| Q8_0 | 8.5 | 33.6 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 63.2 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.0 GB | ~20.2 GB |
| 8K token | ~1.9 GB | ~21.1 GB |
| 32K token | ~7.8 GB | ~27.0 GB |
| 128K token | ~31.1 GB | ~50.3 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~393 tok/s |
| Apple M-series (base) | 100 GB/s | ~39 tok/s |
| Apple M-series Pro | 270 GB/s | ~105 tok/s |
| Apple M-series Max | 410 GB/s | ~160 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~23 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run nemotron-3-nano:30b