← Tüm modellerMODEL TESTİ

Qwen 3.5 35B-A3B çalıştırabilir miyim?

Alibaba imzalı Qwen 3.5 35B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (21.2 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~192 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 3.5 35B-A3B, özünde işe yarar bir numara barındıran bir mixture-of-experts modeli: toplam 35B parametresinin yalnızca yaklaşık 3B'si her token için aktif. Yani küçük bir model hızında üretim yaparken, büyük bir modelin bilgisinden faydalanıyor. İşin püf noktası bellek. Modelin tamamını yine de RAM'de tutuyorsunuz, dolayısıyla aktif dilime göre değil, tam ayak izine göre plan yapın. 4-bit'te 21 GB civarına oturuyor ve en az 32 GB sistem belleği istersiniz. 12 GB'lik bir RTX 3060 bu modeli sığdıramaz, o yüzden gerçekçi olarak bu iş 24 GB'lik bir GPU ya da yüksek bellekli bir Apple Silicon makine işidir.

Bir kez sığdığında MoE tasarımı kendini gösteriyor ve ağırlık sınıfına göre hızlı hissettiriyor. Bir RTX 4090 üzerinde saniyede yaklaşık 471 token, Apple M Max üzerinde ise kabaca 192 görebilirsiniz; ikisi de cevabın okuma hızınızı geçeceği kadar hızlı. DDR5 üzerinde CPU saniyede yaklaşık 28 token çıkarıyor; yavaş ama toplu işler için kullanılabilir. Sohbet, akıl yürütme, kodlama ve görme (vision) işlerini cömert bir 256K bağlam penceresiyle kaldırıyor. Yine de bu tavana dikkatli yaklaşın: 128K bağlamda toplam bellek ayak izi yaklaşık 53.8 GB'a tırmanıyor, yani uzun bağlamlı oturumlar yalnızca ağırlıkları yüklemeye yetecek değil, gerçekten büyük bir makine ister.

Karşılaştırmaya değer aynı boydaki yoğun (dense) bir model olan Command R 35B ile kıyaslandığında, asıl fark parametre sayısı değil MoE mimarisi: nominal boy aynı, ama yalnızca 3B aktif olduğu için Qwen token başına çok daha hızlı çalışma eğiliminde. Bu hız-yetenek oranı onun öne çıkan özelliği; 35B'lik bir bilgi birikimine sahip bir modelden neredeyse anlık üretim, üstüne çok kipli (multimodal) görme desteği alıyorsunuz. Belleğiniz kısıtlıysa ve yalnızca temel sohbet gerekiyorsa daha küçük Qwen 3 0.6B ve 1.7B doğru tercihler. Lisans tarafı işin kolay kısmı: Apache 2.0, ticari kullanım ve üretim dahil olmak üzere modeli özgürce kullanabileceğiniz, sağlayıcıya özgü hiçbir şart okumanıza gerek olmadığı anlamına geliyor.

Teknik özellikler

Parametre35B (3B aktif)
Bağlam penceresi256K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2026-02
En iyi olduğu alanSohbet, Akıl yürütme, Kodlama, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3514.7 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8521.2 GB32 GBÖnerilen
Q5_K_M5.6524.7 GB48 GBYüksek
Q8_08.537.2 GB48 GBOrijinale yakın
F161670.0 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~22.2 GB
8K token~2.0 GB~23.2 GB
32K token~8.1 GB~29.3 GB
128K token~32.6 GB~53.8 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3.5:35b

Sık sorulan sorular

Qwen 3.5 35B-A3B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?