DeepSeek R1 8B çalıştırabilir miyim?
DeepSeek imzalı DeepSeek R1 8B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~63 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
DeepSeek R1 8B, genel amaçlı bir sohbet modeli değil, akıl yürütme odaklı bir model; indirmeden önce bunu bilmek önemli. Yoğun (dense) bir 8B model olduğundan 4-bit nicelemede yaklaşık 4.9 GB'a iniyor ve 8 GB'lik bir GPU'ya rahatça sığıyor; listelenen 8 GB minimum RAM sayesinde mütevazı bir masaüstünde ya da birleşik belleğe sahip herhangi bir Apple Silicon Mac'te çalışabiliyor. MIT lisansı işin kolay tarafı: hiçbir sağlayıcı kısıtı olmadan ticari olarak, üretimde kullanabilirsin. Hızlıca cevap veren değil, bir problemi adım adım düşünen bir model istediğinde buna yönel.
Günlük kullanımda gerçek donanımda boyutuna göre hızlı hissettiriyor. Bir RTX 3060 12GB yaklaşık 63 tok/s, M serisi bir Max civarı 72 tok/s, bir 4090 ise kabaca 177 tok/s veriyor; yani akış (streaming) hiçbir zaman tıkanmıyor. DDR5 üzerinde CPU yaklaşık 11 tok/s'ye düşüyor, arada bir sorgu için yeterli ama sürekli çalışma döngüsü için değil. Asıl dikkat edilmesi gereken nokta şu: R1 sesli düşünüyor, yani düşünce zincirini (chain-of-thought) açıkça yazıyor ve bu yüzden bağlamı düz bir sohbet modelinden daha hızlı tüketiyor. 128K pencere gerçek, ama onu doldurmak toplam belleği kabaca 21.7 GB'a çıkarıyor; bu yüzden kafan rahat değilse çalışma bağlamını ölçülü tut.
Dürüst bir konumlandırmayla söylemek gerekirse bu, küçük bir kutuya sığdırılmış sınır model değil, damıtılmış (distilled) bir akıl yürütme modeli. Llama 3.1 8B ile kıyaslandığında genelde geniş sohbet ustalığından ve araç (tooling) olgunluğundan ödün verip daha güçlü adım adım akıl yürütme sunuyor; daha hafife inmen gerekirse derinlikten biraz feragat pahasına daha küçük DeepSeek R1 7B ve 1.5B de mevcut. Öne çıkan özelliği o görünür akıl yürütme izi: matematik, mantık ve hata ayıklama (debugging) gibi yapılan işi görmek istediğin yerlerde gerçekten faydalı. Çoğunlukla hızlı, gündelik sohbet istiyorsan sohbet için ayarlanmış bir 8B daha iyi bir varsayılan; ama akıl yürüten yerel bir model istiyorsan R1 8B yerini hak ediyor.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 4.9 GB | 8 GB | Önerilen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Yüksek |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Orijinale yakın |
| F16 | 16 | 16.0 GB | 24 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.5 GB | ~5.4 GB |
| 8K token | ~1.0 GB | ~5.9 GB |
| 32K token | ~4.2 GB | ~9.1 GB |
| 128K token | ~16.8 GB | ~21.7 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run deepseek-r1:8bKaynaklar ve indirme