← Tüm modellerMODEL TESTİ

Qwen 3.6 35B-A3B çalıştırabilir miyim?

Alibaba imzalı Qwen 3.6 35B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (21.2 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~192 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 3.6 35B-A3B bir mixture-of-experts modeli ve aslında kime hitap ettiğinin tüm hikayesi de burada. Toplam 35B parametre taşıyor ama token başına yalnızca 3B'sini etkinleştiriyor; yani küçük bir modelin hızıyla çalışırken büyük bir modelin belleğine ihtiyaç duyuyor. 4-bit niceleme (quant) ile ağırlıklar yaklaşık 21.2 GB'a oturuyor, ancak modelin tüm expert setini bellekte tutması için yine de en az 32 GB RAM gerekiyor. Bu da RTX 3060 gibi 12 GB'lık bir kartı devre dışı bırakıyor; oraya sığmıyor. Doğal evi 24 GB'lık bir RTX 4090 ya da bol unified memory'ye sahip bir Apple Silicon Mac.

Günlük kullanımda aktif-3B matematiği işe yarıyor: bir 4090 üzerinde saniyede yaklaşık 471 token, M serisi bir Max'te ise yaklaşık 192 token görebilirsiniz; bu, kendisinin üçte biri boyutundaki çoğu yoğun (dense) modelden bile hızlı. DDR5 üzerinde CPU çıkarımı bile saniyede yaklaşık 28 token çıkarıyor, toplu işler için kullanılabilir seviyede. Sohbet, akıl yürütme, kodlama ve görme (vision) görevlerinin hepsini hallediyor, dolayısıyla tek başına her işi yapan yerel bir model olarak hakkını veriyor. 256K bağlam penceresi cömert, ama püf noktası bellek: sadece 128K'yı doldurmak bile toplam ayak izini yaklaşık 53.8 GB'a çıkarıyor; uzun bağlam işleri 24 GB'lık bir kart değil, 64 GB'lık bir makine istiyor.

Aynı soydan yoğun (dense) Command R 35B ile karşılaştırıldığında, bu MoE aynı nominal boyutta genellikle çok daha hızlı hissettiriyor; çünkü 35B'lik belleğin bedelini ödüyor ama 3B gibi hesaplıyorsunuz. Takas her zamanki MoE takası: yoğun bir 35B, en zorlu tek seferlik akıl yürütme görevlerinde bazen öne geçebiliyor, gerçi çoğu iş için hız kazanıyor. En öne çıkan özelliği, bu hız-yetenek oranının yanında tek pakette gelen yerel görme (vision) desteği. Lisansı Apache 2.0, yani sağlayıcıya bağlı hiçbir koşul olmadan ticari olarak ve üretimde özgürce kullanabilirsiniz.

Teknik özellikler

Parametre35B (3B aktif)
Bağlam penceresi256K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2026-04
En iyi olduğu alanSohbet, Akıl yürütme, Kodlama, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3514.7 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8521.2 GB32 GBÖnerilen
Q5_K_M5.6524.7 GB48 GBYüksek
Q8_08.537.2 GB48 GBOrijinale yakın
F161670.0 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~22.2 GB
8K token~2.0 GB~23.2 GB
32K token~8.1 GB~29.3 GB
128K token~32.6 GB~53.8 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3.6:35b

Sık sorulan sorular