Codestral 22B çalıştırabilir miyim?
Mistral AI imzalı Codestral 22B, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (13.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~26 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Codestral 22B, Mistral AI'nın özellikle kodlama için tasarladığı bir model; serbest sohbetten çok kod tamamlama ve üretmeye odaklı. 22.2 milyar parametresiyle çoğu kişinin başladığı 7B-12B modellere göre gerçek bir boyut sıçraması yapıyor ve bu kendini boyutta belli ediyor: 4-bit niceleme (quant) yaklaşık 13.5 GB tutuyor ve modelin rahat çalışması için en az 24 GB RAM gerekiyor. Bu da onu RTX 3060 gibi 12 GB'lık bir kartın erişiminin dışına itiyor; o kartta basitçe sığmıyor. Gerçekçi giriş noktası, RTX 4090 gibi 24 GB'lık bir GPU ya da bol unified memory'li bir Apple Silicon Mac.
RTX 4090'da 4-bit'te saniyede yaklaşık 64 token bekleyebilirsiniz; kod önerilerinin neredeyse anlık gelmesini sağlayacak kadar hızlı. Apple M serisi Max ~26 tok/s ile biraz daha aşağıda kalıyor ama etkileşimli düzenleme için hâlâ kullanılabilir; DDR5 üzerinde yalnızca CPU ile çalışınca ise ~4 tok/s'ye düşüyor ki bu gerçekten sadece başından kalkıp bekleyebileceğiniz toplu işler için. Bağlam penceresi 32K; bugünün standartlarına göre mütevazı ama çoğu tek dosyalık ve küçük repo işi için fazlasıyla yeterli. Tamamen doldurduğunuzda toplam yaklaşık 20.1 GB belleğe bakıyorsunuz, yani 24 GB'lık bir kartta tam bağlam çok az boşluk bırakıyor.
Aynı aileden modellerle karşılaştırınca Codestral uzman olan taraf: belleğiniz kısıtlıysa Mistral Nemo 12B daha hafif, genel amaçlı sohbet tercihidir ve GPT-OSS 20B genellikle akıl yürütme ile sohbette öne çıkar. Codestral'ın öne çıkan özelliği, birçok dilde özellikle kod için eğitilmiş olması; bu yüzden fill-in-the-middle (ortayı doldurma) tamamlamada ve üretimde aynı boyuttaki genel amaçlı bir modele göre daha isabetli his veriyor. Ciddi uyarı ise lisansta: Codestral, Mistral'ın MNPL lisansıyla, yani üretim dışı (non-production) bir lisansla geliyor; dolayısıyla onu ticari olarak ya da bir üretim ürününde kullanamazsınız. Yalnızca araştırma ve kişisel kullanım aracı olarak değerlendirin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 9.3 GB | 16 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 13.5 GB | 24 GB | Önerilen |
| Q5_K_M | 5.65 | 15.7 GB | 24 GB | Yüksek |
| Q8_0 | 8.5 | 23.6 GB | 32 GB | Orijinale yakın |
| F16 | 16 | 44.4 GB | 64 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.8 GB | ~14.3 GB |
| 8K token | ~1.7 GB | ~15.2 GB |
| 32K token | ~6.6 GB | ~20.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~64 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~17 tok/s |
| Apple M-series Max | 410 GB/s | ~26 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run codestralKaynaklar ve indirme