← Tüm modellerMODEL TESTİ

Qwen 2.5 Coder 32B çalıştırabilir miyim?

Alibaba imzalı Qwen 2.5 Coder 32B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (19.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~18 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 2.5 Coder 32B, Alibaba'nın özellikle kodlama için tasarladığı modeldir ve gerçek programlama işlerinde bulut tabanlı araçlarla cidden boy ölçüşebilen yerel bir asistan isteyenlerin ilk tercihidir. 32.8B parametreyle gelişigüzel indirilecek bir model değil: 4-bit quant yaklaşık 19.9 GB tutuyor ve yüklemek için en az 32 GB RAM gerekiyor. Bu da 12 GB'lık bir RTX 3060'ı tamamen devre dışı bırakıyor; orada basitçe sığmıyor. Modele gerçekçi adresler 24 GB'lık bir kart ya da bol unified bellekli bir Apple Silicon Mac.

Günlük kullanımda hızlı değil, daha ölçülü hissettiriyor ve donanım farkı kendini belli ediyor. RTX 4090'da 4-bit'te aşağı yukarı 43 tok/s bekleyebilirsiniz; bu da kod siz okurken rahatça akacak kadar hızlı. M serisi bir Max ise 18 tok/s civarında kalıyor, kullanılabilir ama gözle görülür biçimde daha sabır isteyen bir tempo; yaklaşık 3 tok/s'lik DDR5 CPU çözümü ise gerçekten yalnızca gece boyu çalışan toplu işler için. 128K bağlam dosyaların tamamını beslemek için cidden faydalı, ama bedava değil: pencereyi sonuna kadar zorlamak toplam belleği 51.6 GB'a doğru itiyor, dolayısıyla yeterli boşluğunuz yoksa çalışma bağlamını ölçülü tutun.

Aynı 32.8B boyutundaki DeepSeek R1 32B ile kıyaslandığında fark esasen amaçta: R1 sesli düşünen bir akıl yürütme modeli, Qwen 2.5 Coder ise düz kod üretimi ve tamamlamada genelde daha doğrudan ve konuya odaklı hissettiriyor. Öne çıkan yanı tam da bu: tek iyi bir GPU'da hâlâ kendi sunucunuzda barındırabileceğiniz bir boyutta kodlamaya odaklanması. Lisans tarafı ise işin kolayı: Apache 2.0, modeli ticari kullanım ve üretim dahil özgürce kullanabileceğiniz, sağlayıcıya özgü hiçbir bağlayıcı şart içermeyen anlamına geliyor.

Teknik özellikler

Parametre32.8B
Bağlam penceresi128K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2024-11
En iyi olduğu alanKodlama

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3513.7 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8519.9 GB32 GBÖnerilen
Q5_K_M5.6523.2 GB32 GBYüksek
Q8_08.534.8 GB48 GBOrijinale yakın
F161665.6 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~20.9 GB
8K token~2.0 GB~21.9 GB
32K token~7.9 GB~27.8 GB
128K token~31.7 GB~51.6 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen2.5-coder:32b

Sık sorulan sorular

Qwen 2.5 Coder 32B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?