← Tüm modellerMODEL TESTİ

Qwen 3.5 122B-A10B çalıştırabilir miyim?

Alibaba imzalı Qwen 3.5 122B-A10B, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (74.0 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~57 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 3.5 122B-A10B, sınır seviyesinde sohbet, akıl yürütme, kod yazma ve görsel anlama yeteneklerini kendi donanımında çalıştırmak isteyenler için büyük bir mixture-of-experts (MoE) modeli. İşin tamamı MoE tasarımında: 122B toplam parametrenin yalnızca 10B'si her token için aktif oluyor, dolayısıyla bu boyuttaki yoğun (dense) bir modele kıyasla çok daha hızlı üretim yapıyor. Asıl sorun bellek, çünkü modelin tamamını yine de bellekte tutman gerekiyor. 4-bit niceleme (quant) ile bu yaklaşık 74 GB ediyor ve modeli yükleyebilmek için kabaca 96 GB RAM gerekiyor. Pratikte bu, yüksek bellekli bir iş istasyonu ya da bol miktarda birleşik (unified) belleğe sahip bir Apple Silicon Mac demek; 24 GB'lık bir RTX 4090'a sığmıyor, 12 GB'lık bir karta ise hiç sığmaz.

Sığdığı yerde ise o 10B aktif parametre sayesinde boyutuna göre şaşırtıcı derecede hızlı hissettiriyor. Bir M Max üzerinde saniyede yaklaşık 57 tok/s bekleyebilirsin; akarken rahatça okuyacak kadar hızlı. Yalnızca CPU ile çalışan bir DDR5 makinede ise bu hız kabaca 8 tok/s'ye düşüyor ve canlı sohbetten çok toplu (batch) işler için uygun hale geliyor. Bağlam penceresi 256K'ya kadar çıkıyor, ama bunu bir tavan olarak gör. Bellek, gerçekte ne kadarını doldurduğunla birlikte büyüyor ve 128K bağlamda toplam ayak izi yaklaşık 131 GB'a tırmanıyor; yani uzun bağlam rakamları, bunun için kurulmuş bir makineyi varsayıyor.

Neredeyse aynı parametre sayısında duran Devstral 2 123B ile karşılaştırıldığında, Qwen 3.5 genel olarak salt kod odağını genişlikle takas ediyor: tek bir modelde uzmanlaşmak yerine sohbet, akıl yürütme ve görsel anlamayı bir arada sunuyor. Bu çok yönlülük onun öne çıkan özelliği; mütevazı donanımda yalnızca hafif sohbete ihtiyacın olduğunda ise daha küçük Qwen 3 0.6B ve 1.7B kardeşleri hâlâ mantıklı seçim olmayı sürdürüyor. Lisansı Apache 2.0, dolayısıyla onu ticari olarak ve üretimde kısıtlama olmadan kullanabilirsin; bu yetenek seviyesinde nadir görülen bir şey ve daha kısıtlı ağırlıklar yerine onu seçmek için gerçek bir neden.

Teknik özellikler

Parametre122B (10B aktif)
Bağlam penceresi256K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2026-02
En iyi olduğu alanSohbet, Akıl yürütme, Kodlama, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3551.1 GB96 GBBelirgin kayıp
Q4_K_MÖnerilen4.8574.0 GB96 GBÖnerilen
Q5_K_M5.6586.2 GB128 GBYüksek
Q8_08.5129.6 GB192 GBOrijinale yakın
F1616244.0 GB256 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.8 GB~75.8 GB
8K token~3.6 GB~77.6 GB
32K token~14.3 GB~88.3 GB
128K token~57.2 GB~131.2 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/sVRAM'e sığmaz
Apple M-series (base)100 GB/s~14 tok/s
Apple M-series Pro270 GB/s~38 tok/s
Apple M-series Max410 GB/s~57 tok/s
CPU only (dual-channel DDR5)60 GB/s~8 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3.5:122b

Sık sorulan sorular