Qwen 3 1.7B çalıştırabilir miyim?
Alibaba imzalı Qwen 3 1.7B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (1.0 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~297 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen 3 1.7B, anında yüklenen ve donanımını neredeyse hiç zorlamayan yerel bir asistan isteyenler için minik bir sohbet modeli. 4-bit quant'ta diskte yaklaşık 1 GB yer kaplıyor ve tamamı kabaca 3 GB RAM içinde çalışıyor; yani neredeyse her şeye sığıyor: eski bir dizüstü, Raspberry Pi sınıfı bir kart, bir telefon ya da var olduğunu unuttuğun düşük seviye bir GPU. Ayrı bir ekran kartın yoksa ya da bellek derdine hiç girmeden arka planda bir şey çalıştırmak istiyorsan başvuracağın model bu.
Gerçek bir GPU üzerinde neredeyse saçmalık derecesinde hızlı. RTX 3060 saniyede yaklaşık 297 token üretiyor, 4090 ise 831'i aşıyor; Apple Silicon M Max ise 338 civarında. DDR5 üzerinde saf CPU bile saniyede yaklaşık 49 token çıkarıyor ki bu hâlâ senin okuma hızından daha hızlı. Bağlam penceresi 32K ve ağır sıkletlerin aksine burada onu fazla zorlanmadan gerçekten doldurabilirsin: tam 32K bağlamda toplam ayak izi yalnızca 3.1 GB civarında, dolayısıyla mütevazı bir makine uzun bir konuşmayı bellekte rahatça tutabiliyor.
Dürüst olalım: 1.7B parametreyle bu bir sohbet modeli, bir akıl yürütme motoru değil. Kısa soru-cevap, yeniden ifade etme ve basit tool-calling işlerini sorunsuz hallediyor; ama çok adımlı mantıkta ya da gerçek planlama gerektiren her şeyde kırılganlaşıyor. Belleğin varsa Qwen 3 4B genelde gözle görülür biçimde daha iyi akıl yürütüyor; daha da kısıtlıysan Qwen 3 0.6B bir alt basamak olarak daha hafif kalıyor, SmolLM2 1.7B ise aynı boyutta, karşılaştırmaya değer bir rakip. En güçlü yanı hız-boyut oranı ve Apache 2.0 olduğu için ticari olarak ve üretimde lisans derdine girmeden kullanabilirsin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 1.0 GB | 3 GB | Önerilen |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Yüksek |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Orijinale yakın |
| F16 | 16 | 3.4 GB | 6 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.3 GB | ~1.3 GB |
| 8K token | ~0.5 GB | ~1.5 GB |
| 32K token | ~2.1 GB | ~3.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3:1.7bKaynaklar ve indirme