Qwen 3.5 27B çalıştırabilir miyim?
Alibaba imzalı Qwen 3.5 27B, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (16.4 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~21 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3.5 27B, bir 8B modelin yetersiz kaldığı ve elinizde harcayacak gerçek bir donanım olduğu durumlarda başvuracağınız model. Sohbet, akıl yürütme, kodlama ve görüntü işlemenin (vision) hepsini kotaran yoğun (dense) bir 27B; yani tek numaralı bir asistan değil, yerelde her işi gören bir beygir gibi çalışıyor. İşin püf noktası boyutu: 4-bit nicelemede yaklaşık 16.4 GB yer kaplıyor ve sorunsuz yüklemek için en az 24 GB RAM istiyorsunuz. Bu da RTX 3060 gibi 12 GB'lık bir kartı devre dışı bırakıyor; oraya basitçe sığmıyor. Sizi ya 24 GB'lık bir GPU'ya ya da bol birleşik belleğe sahip bir Apple Silicon Mac'e yönlendiriyor.
Bir RTX 4090 üzerinde 4-bit nicelemede saniyede yaklaşık 52 token bekleyebilirsiniz; bu, okuma hızınızdan daha akıcı akar ve etkileşimli çalışma için rahat bir tempo sunar. M serisi bir Max'te ise saniyede 21 token civarına oturuyor; sohbet ve kodlama için hâlâ gayet iyi ama uzun üretimlerde yavaşlıyor. DDR5 üzerinde salt CPU ise kabaca saniyede 3 token'a düşüyor ki bu tam bir sabır meselesi. 256K bağlam (context) öne çıkan rakam, ama bunu bir tavan olarak görün: 128K'da toplam bellek yaklaşık 45.4 GB'a tırmanıyor, dolayısıyla 24 GB'lık bir kartta çalışma bağlamınızı azami değerin epey altında tutun.
En doğal karşılaştırma, bu boyut sınıfında görüntü işlemeye sahip diğer açık ağırlıklı 27B olan Gemma 3 27B ile yapılır. Esas olarak cilalı sohbet ve görüntü anlama peşindeyseniz Gemma genelde daha güvenli tercih olurken, Qwen 3.5 27B genellikle kodlama ve yapılandırılmış akıl yürütmede daha güçlü; geliştiriciler için öne çıkan değeri de tam burada. Asıl pratik kazanç ise lisanslama: model Apache 2.0 altında geliyor, yani onu ticari olarak ve üretimde sağlayıcıya özgü hiçbir bağlayıcı koşul olmadan kullanabilirsiniz; Gemma ile gelen açık ağırlık şartlarının aksine.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.3 GB | 16 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 16.4 GB | 24 GB | Önerilen |
| Q5_K_M | 5.65 | 19.1 GB | 32 GB | Yüksek |
| Q8_0 | 8.5 | 28.7 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 54.0 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.9 GB | ~17.3 GB |
| 8K token | ~1.8 GB | ~18.2 GB |
| 32K token | ~7.3 GB | ~23.7 GB |
| 128K token | ~29.0 GB | ~45.4 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3.5:27bKaynaklar ve indirme