Qwen 3 32B çalıştırabilir miyim?
Alibaba imzalı Qwen 3 32B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~18 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3 32B, bir 8B modelin işin zor kısımlarında sürekli takıldığı ve elinizde harcayacak yeterince bellek olduğu durumlarda başvuracağınız model. Sohbet ve akıl yürütme için tasarlanmış, yoğun (dense) 32.8B parametreli bir model; 4-bit niceleme (quant) ile boyutu yaklaşık 19.9 GB. Bu da onu RTX 3060 gibi 12 GB'lık bir kartın erişiminin dışına çıkarıyor; oraya basitçe sığmıyor ve en az 32 GB sistem RAM'i istiyor. Onun için gerçekçi yuvalar, RTX 4090 gibi 24 GB'lık bir GPU ya da bol birleşik (unified) belleğe sahip bir Apple Silicon Mac. Bu her yere taşınabilen bir dizüstü modeli değil; bir iş istasyonu modeli.
Günlük kullanımda hızlıdan çok ölçülü hissettiriyor. Bir RTX 4090'da 4-bit ile saniyede yaklaşık 43 token bekleyebilirsiniz; okuma hızının rahatça üzerinde. M serisi bir Max ise 18 tok/s civarına yerleşiyor, DDR5 üzerinde saf CPU ise yaklaşık 3 tok/s ile sürünüyor; toplu (batch) işler için yeterli ama canlı sohbet için can sıkıcı. 128K bağlam, uzun akıl yürütme zincirleri için gerçekten faydalı, ama ona saygı gösterin: bu bağlamı doldurmak toplam belleği yaklaşık 51.6 GB'a çıkarıyor ve bu tek bir 24 GB'lık kartın sınırını aşıyor. Destekleyecek bellek boşluğunuz yoksa çalışma bağlamını mütevazı tutun.
Diğer 32B akıl yürütme seçeneği DeepSeek R1 32B ile karşılaştırıldığında fark daha çok mizaçla ilgili: R1 açık düşünce zincirine (chain-of-thought) daha sert yaslanma eğilimindeyken, Qwen 3 32B genelde istendiğinde hâlâ akıl yürütebilen, daha dengeli bir genel amaçlı asistan gibi hissettiriyor. Öne çıkan özelliği, geniş yetenek ile temiz bir Apache 2.0 lisansının bir araya gelmesi; yani onu ticari olarak ve üretimde (production) hiçbir hukuki sürtünme olmadan kullanabilirsiniz. Daha küçük Qwen 3 0.6B ve 1.7B sohbet modellerini aştıysanız ve tamamen sahip olduğunuz gerçek bir akıl yürütme ağırlığı istiyorsanız, donanımınız taşıyabildiği sürece bir üst basamak budur.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 19.9 GB | 32 GB | Önerilen |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Yüksek |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 65.6 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.0 GB | ~20.9 GB |
| 8K token | ~2.0 GB | ~21.9 GB |
| 32K token | ~7.9 GB | ~27.8 GB |
| 128K token | ~31.7 GB | ~51.6 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3:32bKaynaklar ve indirme