QwQ 32B çalıştırabilir miyim?
Alibaba imzalı QwQ 32B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~18 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
QwQ 32B, Alibaba'nın akıl yürütmeye odaklı uzman modeli; genel amaçlı bir sohbet modeli değil ve indirmeden önce bunu bilmekte fayda var. 32.8B parametreli yoğun (dense) bir model olup, cevaba ulaşmadan önce uzun düşünce zincirleri boyunca adım adım "sesli düşünür". Bu da onu matematik ve çok adımlı problemlerde güçlü, ama hızlı sorular için yavaş ve fazla konuşkan yapar. 4-bit niceleme (quant) ile boyutu 19.9 GB civarına oturur, dolayısıyla 12 GB'lık RTX 3060 onu tek başına ağırlayamaz. Modeli sorunsuz çalıştırmak için gerçekçi olarak 32 GB sistem ya da birleşik (unified) belleğe ihtiyacınız var; bu da onu sıradan bir oyun kartından çok iş istasyonu, 24 GB GPU veya üst seviye Apple Silicon sınıfına koyar.
Günlük kullanımda model hızlı değil, daha çok ölçülü ve düşünerek hareket eden bir his verir. RTX 4090 üzerinde 4-bit ile kabaca saniyede 43 token bekleyebilirsiniz; bu kulağa iyi gelse de, bu modelin tokenların çoğunu cevaba varmadan önce akıl yürütmeye harcadığını hatırlayın, yani tek bir zor istek epey sürebilir. Apple M Max üzerinde bu rakam saniyede yaklaşık 18 token'a düşer, DDR5 bir CPU'da ise saniyede 3 token civarına kadar sürünür. 128K bağlam gerçektir, ancak bunu sınıra kadar zorlamak toplam belleği 51.6 GB civarına çıkarır; bu da 32 GB tabanını fazlasıyla aşar, o yüzden bol belleğiniz yoksa çalışma bağlamını mütevazı tutun.
Buradaki diğer yoğun 32B akıl yürütücü olan DeepSeek R1 32B ile kıyaslandığında, ikisi boyut ve amaç bakımından birbirine yakın; hangisinin öne çıktığı net bir genel üstünlükten çok yapılan işe göre değişme eğiliminde, bu yüzden ikisini de denemeye değer. Elinizde yalnızca birkaç gigabayt varsa, ufak Qwen 3 0.6B veya 1.7B sohbet modelleri tamamen farklı bir araçtır; hızlı yanıtlar için iyidirler ama QwQ'nun inşa edildiği derin akıl yürütme için değil. QwQ'nun öne çıkan özelliği, kendi sunucunuzda barındırabileceğiniz bir boyutta öncü (frontier) seviyesinde adım adım akıl yürütme sunmasıdır; ayrıca Apache 2.0 olduğu için hiçbir lisans kısıtı olmadan ticari kullanımda ücretsizdir.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 19.9 GB | 32 GB | Önerilen |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Yüksek |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 65.6 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.0 GB | ~20.9 GB |
| 8K token | ~2.0 GB | ~21.9 GB |
| 32K token | ~7.9 GB | ~27.8 GB |
| 128K token | ~31.7 GB | ~51.6 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwq