Devstral 24B çalıştırabilir miyim?
Mistral AI imzalı Devstral 24B, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (14.6 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~24 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Devstral 24B, Mistral AI'nin kodlama uzmanı modeli; genel amaçlı bir sohbet arkadaşı değil, yazılım işleri için yetenekli bir yerel ajan isteyenler düşünülerek yapılmış. 24B yoğun (dense) parametresiyle hafif sıklet değil: 4-bit niceleme yaklaşık 14.6 GB tutuyor ve modelin rahatça çalışması için en az 24 GB civarında RAM gerekiyor. Bu da onu RTX 3060 gibi 12 GB'lik bir kartın erişiminin dışına çıkarıyor; oraya zaten sığmıyor. Doğal evi, RTX 4090 gibi 24 GB'lik bir GPU ya da bol unified bellekli bir Apple Silicon Mac. Yerden tasarruf etmen gerekiyorsa 2-bit sürüm yaklaşık 10.1 GB'a iniyor.
Günlük kodlama kullanımında bir RTX 4090 üzerinde 4-bit'te saniyede yaklaşık 59 token bekleyebilirsin; üretilen kod sen okurken akıcı şekilde akacak kadar hızlı. Apple M serisi Max üzerinde bu rakam saniyede 24 token'a yakın oturuyor, etkileşimli çalışma için hâlâ gayet kullanışlı. Yalnızca CPU ile DDR5 üzerinde ise saniyede yaklaşık 4 token'a düşüyor ki bu sabır gerektiren bir bölge. 128K bağlam penceresi gerçekten büyük, ama bedava değil: onu doldurmak toplam belleği yaklaşık 42.1 GB'a çıkarıyor, modelin boştaki ayak izinin çok ötesine geçiyor; dolayısıyla bol kaynağın yoksa çalışma bağlamını ölçülü tut.
Aynı aileden modellere kıyasla Devstral 24B ağır sıklet olan: Mistral 7B ve Mistral Nemo 12B çok daha hafif ve genel sohbete yönelik, dolayısıyla Devstral'in dokunamayacağı donanımlarda çalışırlar ama gerçek kodlama görevlerinde genelde onun gerisinde kalırlar. Daha yakın bir karşılaştırma Gemma 4 26B A4B; benzer boyutta bir model olup kodlamanın yanında sohbet, akıl yürütme ve görüntü işlemeyi de kaldırıyor ve her iş için tek bir model istiyorsan daha çok yönlü genelci olma eğiliminde. Devstral'in öne çıkan özelliği koda olan dar odağı; Apache 2.0 lisansı sayesinde de ticari üretim dahil olmak üzere onu özgürce kullanabilirsin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 14.6 GB | 24 GB | Önerilen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Yüksek |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 48.0 GB | 64 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.9 GB | ~15.5 GB |
| 8K token | ~1.7 GB | ~16.3 GB |
| 32K token | ~6.9 GB | ~21.5 GB |
| 128K token | ~27.5 GB | ~42.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run devstralKaynaklar ve indirme