Qwen 3.6 35B-A3B çalıştırabilir miyim?
Alibaba imzalı Qwen 3.6 35B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (21.2 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~192 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3.6 35B-A3B bir mixture-of-experts modeli ve aslında kime hitap ettiğinin tüm hikayesi de burada. Toplam 35B parametre taşıyor ama token başına yalnızca 3B'sini etkinleştiriyor; yani küçük bir modelin hızıyla çalışırken büyük bir modelin belleğine ihtiyaç duyuyor. 4-bit niceleme (quant) ile ağırlıklar yaklaşık 21.2 GB'a oturuyor, ancak modelin tüm expert setini bellekte tutması için yine de en az 32 GB RAM gerekiyor. Bu da RTX 3060 gibi 12 GB'lık bir kartı devre dışı bırakıyor; oraya sığmıyor. Doğal evi 24 GB'lık bir RTX 4090 ya da bol unified memory'ye sahip bir Apple Silicon Mac.
Günlük kullanımda aktif-3B matematiği işe yarıyor: bir 4090 üzerinde saniyede yaklaşık 471 token, M serisi bir Max'te ise yaklaşık 192 token görebilirsiniz; bu, kendisinin üçte biri boyutundaki çoğu yoğun (dense) modelden bile hızlı. DDR5 üzerinde CPU çıkarımı bile saniyede yaklaşık 28 token çıkarıyor, toplu işler için kullanılabilir seviyede. Sohbet, akıl yürütme, kodlama ve görme (vision) görevlerinin hepsini hallediyor, dolayısıyla tek başına her işi yapan yerel bir model olarak hakkını veriyor. 256K bağlam penceresi cömert, ama püf noktası bellek: sadece 128K'yı doldurmak bile toplam ayak izini yaklaşık 53.8 GB'a çıkarıyor; uzun bağlam işleri 24 GB'lık bir kart değil, 64 GB'lık bir makine istiyor.
Aynı soydan yoğun (dense) Command R 35B ile karşılaştırıldığında, bu MoE aynı nominal boyutta genellikle çok daha hızlı hissettiriyor; çünkü 35B'lik belleğin bedelini ödüyor ama 3B gibi hesaplıyorsunuz. Takas her zamanki MoE takası: yoğun bir 35B, en zorlu tek seferlik akıl yürütme görevlerinde bazen öne geçebiliyor, gerçi çoğu iş için hız kazanıyor. En öne çıkan özelliği, bu hız-yetenek oranının yanında tek pakette gelen yerel görme (vision) desteği. Lisansı Apache 2.0, yani sağlayıcıya bağlı hiçbir koşul olmadan ticari olarak ve üretimde özgürce kullanabilirsiniz.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 21.2 GB | 32 GB | Önerilen |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Yüksek |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 70.0 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.0 GB | ~22.2 GB |
| 8K token | ~2.0 GB | ~23.2 GB |
| 32K token | ~8.1 GB | ~29.3 GB |
| 128K token | ~32.6 GB | ~53.8 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3.6:35bKaynaklar ve indirme