← Tüm modellerMODEL TESTİ

SmolLM2 1.7B çalıştırabilir miyim?

Hugging Face imzalı SmolLM2 1.7B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (1.0 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~297 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

SmolLM2 1.7B, Llama 8B'nin fazla kaçtığı durumlar için: neredeyse her yerde çalıştırabileceğiniz, gerçekten minik bir sohbet modeli. 4-bit'te yaklaşık 1 GB yer kaplıyor ve çalışma alanıyla birlikte bellekte tutmak için yalnızca 3 GB civarı RAM yetiyor; yani temel bir M1 Mac'te, bütçe dostu bir dizüstüde, Raspberry Pi sınıfı bir kartta ya da biraz boşluğu olan herhangi bir modern telefonda rahatça koşuyor. Lisansı Apache 2.0, bu da onu ticari olarak ve üretimde, sağlayıcı tarafında hiçbir bağlayıcı şart olmadan kullanabileceğiniz anlamına geliyor. Bunu, gün boyu karşısına geçip sohbet ettiğiniz model değil, ürününüze gömdüğünüz model olarak düşünün.

Günlük kullanımda öne çıkan şey ham işlem hızı. Bir RTX 3060'ta saniyede yaklaşık 297 token üretiyor, bir M Max yaklaşık 338'e çıkıyor, bir 4090 ise kabaca 831'e ulaşıyor; okuyabileceğinizden çok daha hızlı. Düz bir DDR5 CPU'da bile saniyede 49 token civarı yapıyor, ki hiç GPU olmadan kısa yanıtlar için fazlasıyla kullanışlı. Asıl sınır 8K bağlam penceresi. Bugünün ölçülerine göre küçük, dolayısıyla tek soru, sınıflandırma ve kısa özetler için iyi iş çıkarıyor ama uzun bir belgeyi tutamaz. Bellek burada hiç dert değil: 8K'nın tamamını doldursanız bile toplam ancak 1.5 GB'a varıyor.

1.7B'nin size ne kazandırdığı konusunda dürüst olalım. Hafif sohbet, biçimlendirme ve basit talimat takibini halleder ama çok adımlı akıl yürütmede ve uzun kodlama görevlerinde yetersiz kalır. Qwen 3 1.7B, daha zorlu ve yapılandırılmış istemlerde genellikle onun bir adım önüne geçer; DeepSeek R1 1.5B ise hızlı yanıtlar yerine gerçekten zincirleme düşünme (chain-of-thought) gerektiğinde daha iyi sonuç verme eğilimindedir. Llama 3.2 1B'ye karşı biraz daha fazla ağırlığı, daha istikrarlı çıktıyla takas ediyor. Öne çıkan özelliği verimlilik: tamamen açık, ticari olarak kullanılabilir ve bu kadar yetenekli başka hiçbir şeyin dokunamayacağı donanımda hızlı koşan bir asistan. Derinlikten çok yer kaplamanın önem taşıdığı durumlarda ona uzanın.

Teknik özellikler

Parametre1.7B
Bağlam penceresi8K token
SağlayıcıHugging Face
LisansApache 2.0
Çıkış2024-11
En iyi olduğu alanSohbet

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.350.7 GB3 GBBelirgin kayıp
Q4_K_MÖnerilen4.851.0 GB3 GBÖnerilen
Q5_K_M5.651.2 GB3 GBYüksek
Q8_08.51.8 GB4 GBOrijinale yakın
F16163.4 GB6 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.3 GB~1.3 GB
8K token~0.5 GB~1.5 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run smollm2

Sık sorulan sorular