← Tüm modellerMODEL TESTİ

QwQ 32B çalıştırabilir miyim?

Alibaba imzalı QwQ 32B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~18 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

QwQ 32B, Alibaba'nın akıl yürütmeye odaklı uzman modeli; genel amaçlı bir sohbet modeli değil ve indirmeden önce bunu bilmekte fayda var. 32.8B parametreli yoğun (dense) bir model olup, cevaba ulaşmadan önce uzun düşünce zincirleri boyunca adım adım "sesli düşünür". Bu da onu matematik ve çok adımlı problemlerde güçlü, ama hızlı sorular için yavaş ve fazla konuşkan yapar. 4-bit niceleme (quant) ile boyutu 19.9 GB civarına oturur, dolayısıyla 12 GB'lık RTX 3060 onu tek başına ağırlayamaz. Modeli sorunsuz çalıştırmak için gerçekçi olarak 32 GB sistem ya da birleşik (unified) belleğe ihtiyacınız var; bu da onu sıradan bir oyun kartından çok iş istasyonu, 24 GB GPU veya üst seviye Apple Silicon sınıfına koyar.

Günlük kullanımda model hızlı değil, daha çok ölçülü ve düşünerek hareket eden bir his verir. RTX 4090 üzerinde 4-bit ile kabaca saniyede 43 token bekleyebilirsiniz; bu kulağa iyi gelse de, bu modelin tokenların çoğunu cevaba varmadan önce akıl yürütmeye harcadığını hatırlayın, yani tek bir zor istek epey sürebilir. Apple M Max üzerinde bu rakam saniyede yaklaşık 18 token'a düşer, DDR5 bir CPU'da ise saniyede 3 token civarına kadar sürünür. 128K bağlam gerçektir, ancak bunu sınıra kadar zorlamak toplam belleği 51.6 GB civarına çıkarır; bu da 32 GB tabanını fazlasıyla aşar, o yüzden bol belleğiniz yoksa çalışma bağlamını mütevazı tutun.

Buradaki diğer yoğun 32B akıl yürütücü olan DeepSeek R1 32B ile kıyaslandığında, ikisi boyut ve amaç bakımından birbirine yakın; hangisinin öne çıktığı net bir genel üstünlükten çok yapılan işe göre değişme eğiliminde, bu yüzden ikisini de denemeye değer. Elinizde yalnızca birkaç gigabayt varsa, ufak Qwen 3 0.6B veya 1.7B sohbet modelleri tamamen farklı bir araçtır; hızlı yanıtlar için iyidirler ama QwQ'nun inşa edildiği derin akıl yürütme için değil. QwQ'nun öne çıkan özelliği, kendi sunucunuzda barındırabileceğiniz bir boyutta öncü (frontier) seviyesinde adım adım akıl yürütme sunmasıdır; ayrıca Apache 2.0 olduğu için hiçbir lisans kısıtı olmadan ticari kullanımda ücretsizdir.

Teknik özellikler

Parametre32.8B
Bağlam penceresi128K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2025-03
En iyi olduğu alanAkıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3513.7 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8519.9 GB32 GBÖnerilen
Q5_K_M5.6523.2 GB32 GBYüksek
Q8_08.534.8 GB48 GBOrijinale yakın
F161665.6 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~20.9 GB
8K token~2.0 GB~21.9 GB
32K token~7.9 GB~27.8 GB
128K token~31.7 GB~51.6 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwq

Sık sorulan sorular