Qwen 3 8B çalıştırabilir miyim?
Alibaba imzalı Qwen 3 8B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (5.0 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~62 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3 8B, sadece sohbet eden değil, biraz da gerçekten düşünebilen yerel bir asistan istediğinizde uzanacağınız model. 4-bit niceleme ile yaklaşık 5 GB'a sığıyor, yani 8 GB'lık bir GPU'ya rahatça yerleşiyor; 8 GB minimum RAM şartı da temel bir Apple Silicon Mac'in ya da orta seviye bir masaüstünün onu sorunsuz çalıştırabileceği anlamına geliyor. Asıl öne çıkan özelliği hibrit düşünme modu: yanıt vermeden önce bir problemi adım adım akıl yürüterek fazladan token harcayabiliyor. İnsanların onu aynı 8B sınıfındaki düz sohbet modellerine tercih etmesinin nedeni de bu.
Günlük kullanımda hızlı hissettiriyor. RTX 3060 12GB üzerinde kabaca ~62 tok/s, M serisi Max'te ~70 tok/s, RTX 4090 ise onu ~172 tok/s'ye kadar çıkarıyor; hepsi de yanıtların okuma hızınızı geçeceği kadar hızlı. Sadece CPU ile DDR5'te bu ~10 tok/s'ye düşüyor; toplu işler için yeterli ama etkileşimli kullanım için değil. 128K bağlam gerçek, ama dikkatli olun: bağlamı sonuna kadar doldurmak toplam belleği yaklaşık 22 GB'a çıkarıyor; bu da 8 GB'lık bir kartın tutabileceğinin çok ötesinde. O yüzden elinizde yer yoksa çalışma bağlamını ölçülü tutun veya 3.4 GB'lık q2 sürümüne inin.
Esas olarak sohbete yönelik, benzer boyutta bir açık model olan Granite 3.3 8B ile karşılaştırıldığında, Qwen 3 8B düşünme modu sayesinde çok adımlı akıl yürütme ve matematikte genellikle önde; Granite ise daha sohbet odaklı hissettiriyor. En dikkat çekici özelliği, bu kadar küçük bir pakette o akıl yürütme anahtarına sahip olması. Lisans tarafı ise işin kolay kısmı: Apache 2.0, modeli ticari olarak ve üretimde, sağlayıcıya özel hiçbir bağlayıcı koşul olmadan kullanabileceğiniz anlamına geliyor. Bu boyutta olması gerekenden çok daha nadir bir durum.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 5.0 GB | 8 GB | Önerilen |
| Q5_K_M | 5.65 | 5.8 GB | 12 GB | Yüksek |
| Q8_0 | 8.5 | 8.7 GB | 16 GB | Orijinale yakın |
| F16 | 16 | 16.4 GB | 24 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.5 GB | ~5.5 GB |
| 8K token | ~1.1 GB | ~6.1 GB |
| 32K token | ~4.2 GB | ~9.2 GB |
| 128K token | ~17.0 GB | ~22.0 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~62 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~172 tok/s |
| Apple M-series (base) | 100 GB/s | ~17 tok/s |
| Apple M-series Pro | 270 GB/s | ~46 tok/s |
| Apple M-series Max | 410 GB/s | ~70 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~10 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3Kaynaklar ve indirme