← Tüm modellerMODEL TESTİ

Nemotron 3 Nano 30B-A3B çalıştırabilir miyim?

NVIDIA imzalı Nemotron 3 Nano 30B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.2 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~160 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Nemotron 3 Nano, NVIDIA'nın mixture-of-experts (MoE) modeli; yoğun (dense) model maliyetlerini ödemeden yerel makinede güçlü sohbet, akıl yürütme ve kodlama isteyenler için tasarlanmış. Hilesi adında gizli: toplam 31.6B parametre taşıyor ama her token için bunların yalnızca 3.6B kadarını çalıştırıyor, yani çok küçük bir modelin hızında üretirken çok daha büyük bir modelin aklıyla düşünüyor. Her MoE'ye yeni başlayanın zor yoldan öğrendiği detay şu: yine de modelin tamamını belleğe yüklemeniz gerekiyor. 4-bit niceleme (quant) ile bu kabaca 19 GB ağırlık demek ve en az 32 GB RAM istersiniz; bu da RTX 3060 gibi 12 GB'lık bir kartı tamamen devre dışı bırakıyor.

Günlük kullanımda aktif parametre hilesi kendini gerçekten gösteriyor. RTX 4090 üzerinde saniyede yaklaşık 393 token akıtıyor ki bu kadar yetenekli bir model için bu absürt derecede hızlı; Apple Silicon M Max bile unified memory üzerinde 160 tok/s civarında oturuyor. DDR5 ile yalnızca CPU'da bu rakam yaklaşık 23 tok/s'ye düşüyor; toplu işler için kullanışlı ama interaktif sohbet için değil. Öne çıkan özellik 1,000K bağlam penceresi, ama bunu bir reklam panosu rakamı olarak görün: yalnızca 128K bağlamda toplam bellek ayak izi yaklaşık 50 GB'a tırmanıyor, yani 32 GB'lık bir makinede gerçekçi olarak bir milyon değil, birkaç on bin token ile çalışıyorsunuz.

Rakipleriyle kıyaslandığında, görüntü (vision) gerekiyorsa Gemma 4 31B daha esnek bir tercih çünkü Nemotron 3 Nano yalnızca metin destekliyor; MoE'nin bellek tuhaflıklarıyla uğraşmak istemezseniz Granite 4.0 H Small benzer boyutta yoğun (dense) bir alternatif. Nemotron'un en iyi yaptığı şey kalite başına verim: bu boyut sınıfında çok adımlı akıl yürütmeyi hâlâ kaldırırken bu kadar hızlı üreten başka bir model yok. Üzerine bir şey inşa etmeden önce bir uyarı: NVIDIA Open Model lisansı açık ağırlıklı (open-weight), gerçek anlamda açık kaynak değil; bu yüzden ticari kullanım için Apache tarzı bir özgürlük varsaymak yerine şartları dikkatlice okuyun.

Teknik özellikler

Parametre31.6B (3.6B aktif)
Bağlam penceresi1M token
SağlayıcıNVIDIA
LisansNVIDIA Open Model
Çıkış2025-12
En iyi olduğu alanSohbet, Akıl yürütme, Kodlama

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3513.2 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8519.2 GB32 GBÖnerilen
Q5_K_M5.6522.3 GB32 GBYüksek
Q8_08.533.6 GB48 GBOrijinale yakın
F161663.2 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~20.2 GB
8K token~1.9 GB~21.1 GB
32K token~7.8 GB~27.0 GB
128K token~31.1 GB~50.3 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run nemotron-3-nano:30b

Sık sorulan sorular