← Tüm modellerMODEL TESTİ

Qwen 3 30B-A3B çalıştırabilir miyim?

Alibaba imzalı Qwen 3 30B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (18.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~174 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 3 30B-A3B bir mixture-of-experts (uzman karması) modeli ve bu tek gerçek, modeli nasıl değerlendirmen gerektiğini baştan sona belirliyor. Kâğıt üzerinde 30.5B parametresi var ama her token için bunların yalnızca 3.3B'si aktif oluyor; yani küçük bir modelin hızında çalışırken büyük bir modelin genişliğiyle akıl yürütüyor. Püf noktası bellekte: yine de modelin tamamını RAM'de tutman gerekiyor. 4-bit quant yaklaşık 18.5 GB ve model rahat nefes almak için en az 32 GB istiyor. Bu da RTX 3060 gibi 12 GB'lık bir kartı dışarıda bırakıyor ama 32 GB Apple Silicon Mac'e rahatça sığıyor; context'i ölçülü tutarsan 24 GB'lık bir 4090'a da olur.

Günlük kullanımda MoE tasarımı, teknik özet sayfasının hakkını veremediği bir şekilde işe yarıyor. Bir 4090'da saniyede yaklaşık 428 token görebiliyorsun ve bir M-serisi Max bile kabaca 174 tok/s ile hızlı kalıyor; aynı donanımda yoğun (dense) bir 30B'nin asla ulaşamayacağı bir hız. DDR5 üzerinde yalnızca CPU ile bu rakam yaklaşık 25 tok/s'ye düşüyor; toplu işler için kullanılabilir ama etkileşimli sohbet için değil. 128K context gerçek, ama bütçeye dikkat: tamamını doldurmak toplam belleği yaklaşık 49.1 GB'a çıkarıyor. Bu yüzden 32 GB'lık bir makinede çalışma context'ini ölçülü tut ve tüm pencereyi zorlamak yerine daha küçük bir quant'a yaslan.

Neredeyse aynı parametre sayısına (30.7B) sahip Gemma 4 31B ile karşılaştırınca takas net. Gemma yoğun (dense) bir model ve üstüne kod ile görü (vision) yetenekleri ekliyor; bu yüzden multimodal ve yapılandırılmış kod işlerinde daha güçlü hissettiriyor. Buna karşılık Qwen 3 30B-A3B'nin seyrek (sparse) tasarımı, bu boyut sınıfında sohbet ve akıl yürütmede onu token başına çarpıcı biçimde daha hızlı yapıyor. Kapladığı yere göre bu hız, modelin öne çıkan özelliği. Ayrıca Apache 2.0 lisansıyla geliyor; yani sağlayıcıya özgü açık-ağırlık koşullarının aksine, hiçbir lisans çekincesi olmadan onu ticari ve üretim işlerinde özgürce kullanabilirsin.

Teknik özellikler

Parametre30.5B (3.3B aktif)
Bağlam penceresi128K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2025-04
En iyi olduğu alanSohbet, Akıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3512.8 GB24 GBBelirgin kayıp
Q4_K_MÖnerilen4.8518.5 GB32 GBÖnerilen
Q5_K_M5.6521.5 GB32 GBYüksek
Q8_08.532.4 GB48 GBOrijinale yakın
F161661.0 GB96 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.0 GB~19.5 GB
8K token~1.9 GB~20.4 GB
32K token~7.7 GB~26.2 GB
128K token~30.6 GB~49.1 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~428 tok/s
Apple M-series (base)100 GB/s~42 tok/s
Apple M-series Pro270 GB/s~115 tok/s
Apple M-series Max410 GB/s~174 tok/s
CPU only (dual-channel DDR5)60 GB/s~25 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3:30b

Sık sorulan sorular

Qwen 3 30B-A3B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?