Qwen 3 4B çalıştırabilir miyim?
Alibaba imzalı Qwen 3 4B, önerilen 4-bit nicemlemede yaklaşık 6 GB RAM ister (2.4 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~126 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3 4B, küçük bir modelden gerçek anlamda akıl yürütme beklediğinizde başvuracağınız model. 4-bit niceleme ile yaklaşık 2.4 GB'a indiği için neredeyse her yere sığar: 6 GB'lık bir GPU'da bol bol yeri vardır, herhangi bir Apple Silicon Mac onu tek lokmada yutar, entegre ekran kartlı eski bir dizüstü bile çalıştırabilir. Rahat kullanım için isteyeceğiniz alt sınır yaklaşık 6 GB RAM. Yalnızca CPU'lu bir makinede ya da Raspberry sınıfı bir cihazda çalışıyorsanız, bu, bu boyutta sadece teknik olarak yüklenebilir kalmak yerine gerçekten işe yarar kalan az sayıdaki modelden biri.
Günlük kullanımda hızlı hissettiriyor. Bir RTX 3060 üzerinde 4-bit ile saniyede kabaca 126 token üretiyor, M serisi bir Max ise 144 civarında; ikisi de okuma hızının çok üzerinde, dolayısıyla sohbet ve kısa akıl yürütme zincirlerinde yanıtlar anında akıyor. Elinizde bir 4090 varsa 353 civarına çıkıyor. DDR5 üzerinde saf CPU saniyede yaklaşık 21 token'a düşüyor; yavaş ama arka plan işleri için iş görür. Bağlam penceresi 32K, çoğu iş için fazlasıyla yeterli, ama onu doldurmak toplam belleği kabaca 5.5 GB'a çıkarıyor; bu yüzden kıt 6 GB'lık bir makinede çalışma bağlamınızı mütevazı tutun.
Kendi ailesi içinde Qwen 3 4B, küçük model çok adımlı istemlerde tökezlemeye başladığında Qwen 3 1.7B'den net bir adım yukarısı; üstelik 7-8B katmanından çok daha hafif kalıyor. Phi-4 Mini 3.8B benzer boyutta makul bir alternatif ve sohbette genelde başa baş gidiyor, ama Qwen 3 4B'nin öne çıkan özelliği, çalıştırma maliyetinin ne kadar düşük olduğu düşünüldüğünde akıl yürütme görevlerinde parametre sayısının üstünde bir performans sergilemesi. Apache 2.0 altında dağıtılıyor, yani lisans kaygısı olmadan ticari olarak ve üretimde kullanabilirsiniz; bu kalite-boyut oranında nadir bir durum.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.7 GB | 4 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 2.4 GB | 6 GB | Önerilen |
| Q5_K_M | 5.65 | 2.8 GB | 6 GB | Yüksek |
| Q8_0 | 8.5 | 4.3 GB | 8 GB | Orijinale yakın |
| F16 | 16 | 8.0 GB | 12 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.4 GB | ~2.8 GB |
| 8K token | ~0.8 GB | ~3.2 GB |
| 32K token | ~3.1 GB | ~5.5 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3:4bKaynaklar ve indirme