Qwen 3 30B-A3B çalıştırabilir miyim?
Alibaba imzalı Qwen 3 30B-A3B, önerilen 4-bit nicemlemede yaklaşık 32 GB RAM ister (18.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~174 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3 30B-A3B bir mixture-of-experts (uzman karması) modeli ve bu tek gerçek, modeli nasıl değerlendirmen gerektiğini baştan sona belirliyor. Kâğıt üzerinde 30.5B parametresi var ama her token için bunların yalnızca 3.3B'si aktif oluyor; yani küçük bir modelin hızında çalışırken büyük bir modelin genişliğiyle akıl yürütüyor. Püf noktası bellekte: yine de modelin tamamını RAM'de tutman gerekiyor. 4-bit quant yaklaşık 18.5 GB ve model rahat nefes almak için en az 32 GB istiyor. Bu da RTX 3060 gibi 12 GB'lık bir kartı dışarıda bırakıyor ama 32 GB Apple Silicon Mac'e rahatça sığıyor; context'i ölçülü tutarsan 24 GB'lık bir 4090'a da olur.
Günlük kullanımda MoE tasarımı, teknik özet sayfasının hakkını veremediği bir şekilde işe yarıyor. Bir 4090'da saniyede yaklaşık 428 token görebiliyorsun ve bir M-serisi Max bile kabaca 174 tok/s ile hızlı kalıyor; aynı donanımda yoğun (dense) bir 30B'nin asla ulaşamayacağı bir hız. DDR5 üzerinde yalnızca CPU ile bu rakam yaklaşık 25 tok/s'ye düşüyor; toplu işler için kullanılabilir ama etkileşimli sohbet için değil. 128K context gerçek, ama bütçeye dikkat: tamamını doldurmak toplam belleği yaklaşık 49.1 GB'a çıkarıyor. Bu yüzden 32 GB'lık bir makinede çalışma context'ini ölçülü tut ve tüm pencereyi zorlamak yerine daha küçük bir quant'a yaslan.
Neredeyse aynı parametre sayısına (30.7B) sahip Gemma 4 31B ile karşılaştırınca takas net. Gemma yoğun (dense) bir model ve üstüne kod ile görü (vision) yetenekleri ekliyor; bu yüzden multimodal ve yapılandırılmış kod işlerinde daha güçlü hissettiriyor. Buna karşılık Qwen 3 30B-A3B'nin seyrek (sparse) tasarımı, bu boyut sınıfında sohbet ve akıl yürütmede onu token başına çarpıcı biçimde daha hızlı yapıyor. Kapladığı yere göre bu hız, modelin öne çıkan özelliği. Ayrıca Apache 2.0 lisansıyla geliyor; yani sağlayıcıya özgü açık-ağırlık koşullarının aksine, hiçbir lisans çekincesi olmadan onu ticari ve üretim işlerinde özgürce kullanabilirsin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 12.8 GB | 24 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 18.5 GB | 32 GB | Önerilen |
| Q5_K_M | 5.65 | 21.5 GB | 32 GB | Yüksek |
| Q8_0 | 8.5 | 32.4 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 61.0 GB | 96 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.0 GB | ~19.5 GB |
| 8K token | ~1.9 GB | ~20.4 GB |
| 32K token | ~7.7 GB | ~26.2 GB |
| 128K token | ~30.6 GB | ~49.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~428 tok/s |
| Apple M-series (base) | 100 GB/s | ~42 tok/s |
| Apple M-series Pro | 270 GB/s | ~115 tok/s |
| Apple M-series Max | 410 GB/s | ~174 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~25 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3:30bKaynaklar ve indirme