← Tüm modellerMODEL TESTİ

Qwen 3 1.7B çalıştırabilir miyim?

Alibaba imzalı Qwen 3 1.7B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (1.0 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~297 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen 3 1.7B, anında yüklenen ve donanımını neredeyse hiç zorlamayan yerel bir asistan isteyenler için minik bir sohbet modeli. 4-bit quant'ta diskte yaklaşık 1 GB yer kaplıyor ve tamamı kabaca 3 GB RAM içinde çalışıyor; yani neredeyse her şeye sığıyor: eski bir dizüstü, Raspberry Pi sınıfı bir kart, bir telefon ya da var olduğunu unuttuğun düşük seviye bir GPU. Ayrı bir ekran kartın yoksa ya da bellek derdine hiç girmeden arka planda bir şey çalıştırmak istiyorsan başvuracağın model bu.

Gerçek bir GPU üzerinde neredeyse saçmalık derecesinde hızlı. RTX 3060 saniyede yaklaşık 297 token üretiyor, 4090 ise 831'i aşıyor; Apple Silicon M Max ise 338 civarında. DDR5 üzerinde saf CPU bile saniyede yaklaşık 49 token çıkarıyor ki bu hâlâ senin okuma hızından daha hızlı. Bağlam penceresi 32K ve ağır sıkletlerin aksine burada onu fazla zorlanmadan gerçekten doldurabilirsin: tam 32K bağlamda toplam ayak izi yalnızca 3.1 GB civarında, dolayısıyla mütevazı bir makine uzun bir konuşmayı bellekte rahatça tutabiliyor.

Dürüst olalım: 1.7B parametreyle bu bir sohbet modeli, bir akıl yürütme motoru değil. Kısa soru-cevap, yeniden ifade etme ve basit tool-calling işlerini sorunsuz hallediyor; ama çok adımlı mantıkta ya da gerçek planlama gerektiren her şeyde kırılganlaşıyor. Belleğin varsa Qwen 3 4B genelde gözle görülür biçimde daha iyi akıl yürütüyor; daha da kısıtlıysan Qwen 3 0.6B bir alt basamak olarak daha hafif kalıyor, SmolLM2 1.7B ise aynı boyutta, karşılaştırmaya değer bir rakip. En güçlü yanı hız-boyut oranı ve Apache 2.0 olduğu için ticari olarak ve üretimde lisans derdine girmeden kullanabilirsin.

Teknik özellikler

Parametre1.7B
Bağlam penceresi32K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2025-04
En iyi olduğu alanSohbet

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.350.7 GB3 GBBelirgin kayıp
Q4_K_MÖnerilen4.851.0 GB3 GBÖnerilen
Q5_K_M5.651.2 GB3 GBYüksek
Q8_08.51.8 GB4 GBOrijinale yakın
F16163.4 GB6 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.3 GB~1.3 GB
8K token~0.5 GB~1.5 GB
32K token~2.1 GB~3.1 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3:1.7b

Sık sorulan sorular

Qwen 3 1.7B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?