DeepSeek R1 1.5B çalıştırabilir miyim?
DeepSeek imzalı DeepSeek R1 1.5B, önerilen 4-bit nicemlemede yaklaşık 3 GB RAM ister (1.1 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~280 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
DeepSeek R1 1.5B damıtılmış (distilled) bir akıl yürütme modeli ve bu kelime önemli: laf olsun diye sohbet etmek yerine bir problemi adım adım, sesli düşünerek çözmeye ayarlanmış. 1.8B parametreyle minicik. 4-bit quant yaklaşık 1.1 GB'a oturuyor, 8-bit sürüm bile sadece 1.9 GB; yani 3 GB'lık minimum RAM'in epey altında kalıyor. Bu da onu her yerde çalışabilir kılıyor: eski bir dizüstü, Raspberry Pi sınıfı bir kart, bir telefon ya da GPU'nuza neredeyse hiç dokunmayan bir arka plan yardımcısı olarak. ollama run deepseek-r1:1.5b ile çekin, saniyeler içinde kullanmaya başlarsınız.
Günlük kullanımda gerçekten hızlı. RTX 3060'ta saniyede yaklaşık 280 token bekleyebilirsiniz, 4090 neredeyse 785'e çıkıyor, Apple M-serisi Max ise 319 civarında; yani gördüğünüz yanıtın hızını ham performanstan çok modelin ne kadar süre akıl yürüttüğü belirliyor. DDR5 üzerinde saf CPU bile kabaca 47 token/s'i kotarıyor. 128K bağlam ise işin püf noktası: bu model kendi düşünce zincirinde (chain-of-thought) bolca token harcıyor ve o pencereyi doldurmak toplam belleği yaklaşık 9.7 GB'a, boştaki ayak izinin epey ötesine itiyor. Çalışma bağlamını ölçülü tutun ve modelin kısa aralıklarla düşünmesine izin verin.
Açık konuşmak gerekirse, bu boyutta akıl yürütme çok adımlı her şeyde ya tutar ya tutmaz; cevabın gerçekten önem taşıdığı durumlarda büyük kardeşleri DeepSeek R1 7B ve R1 8B çok daha güvenilir, görünür akıl yürütmeden ziyade düz sohbet istiyorsanız da Qwen 3 1.7B daha doğru tercih. 1.5B'nin kazandığı yer ise erişim: R1 tarzı düşünce izlerini lokal olarak çalıştırmanın en küçük yolu bu ve bunu başka hiçbir şeyin dönmeyeceği donanımda yapıyor. MIT lisansı da cabası: tamamen açık, ticari kullanımı serbest ve hiçbir koşula bağlı değil.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.8 GB | 3 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 1.1 GB | 3 GB | Önerilen |
| Q5_K_M | 5.65 | 1.3 GB | 4 GB | Yüksek |
| Q8_0 | 8.5 | 1.9 GB | 4 GB | Orijinale yakın |
| F16 | 16 | 3.6 GB | 6 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.3 GB | ~1.4 GB |
| 8K token | ~0.5 GB | ~1.6 GB |
| 32K token | ~2.1 GB | ~3.2 GB |
| 128K token | ~8.6 GB | ~9.7 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~280 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~785 tok/s |
| Apple M-series (base) | 100 GB/s | ~78 tok/s |
| Apple M-series Pro | 270 GB/s | ~210 tok/s |
| Apple M-series Max | 410 GB/s | ~319 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~47 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run deepseek-r1:1.5bKaynaklar ve indirme