Ministral 3 8B çalıştırabilir miyim?
Mistral AI imzalı Ministral 3 8B, önerilen 4-bit nicemlemede yaklaşık 8 GB RAM ister (4.9 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~63 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Ministral 3 8B, Mistral'in 2025 sonunda çıkardığı küçük, her işi gören yerel model yorumu; hem sohbeti hem de görselleri aynı 8B'lik pakette hallediyor. 4-bit quant'ta yaklaşık 4.9 GB tutuyor, yani 8 GB'lık bir GPU'ya bol bol sığıyor ve herhangi bir Apple Silicon Mac'in birleşik belleğinde rahatça çalışıyor. 8 GB minimum RAM rakamı yalnızca ağırlıklar için dürüst bir değer; bu da modeli iş istasyonu gerektiren bir şey olarak değil, bir dizüstüde ya da ucuz ikinci el bir GPU'da gerçekçi bir tercih olarak konumlandırıyor.
Günlük kullanımda hızlı hissettiriyor. RTX 3060'ta 4-bit'te saniyede yaklaşık 63 token bekleyebilirsiniz, RTX 4090 bunu kabaca 177'ye çıkarıyor, M serisi Max ise 72 civarında oturuyor; hepsi de akan bir yanıtı okuyabileceğinizden daha hızlı. Asıl manşet 256K bağlam penceresi, ama bunu varsayılan değil bir tavan olarak görün. 128K bağlamda toplam bellek ayak izi yaklaşık 21.7 GB'a tırmanıyor; bu da 8 GB'lık bir kartın tutabileceğinin çok ötesinde. Bu yüzden uzun pencereyi destekleyecek VRAM'iniz yoksa çalışma bağlamını birkaç bin token ile sınırlı tutun.
Kardeşleri arasında ortayı buluyor: Mistral Nemo 12B, daha büyük modeli kaldırabiliyorsanız zor akıl yürütme için genelde daha fazla alan tanıyor; Mistral 7B ise bellek kısıtlıyken daha yalın bir yedek. Ministral 3 8B'nin öne çıkan özelliği, görsel yeteneğin de aynı küçük ayak izine sığması; böylece daha ağır bir çok kipli (multimodal) modele geçmeden görüntü anlama elde ediyorsunuz. Apache 2.0 lisansıyla geliyor; bu da onu sağlayıcıya özel hiçbir bağ olmadan ticari olarak ve üretimde kullanabileceğiniz anlamına geliyor — bu kadar yetenekli bir model için gerçekten temiz bir lisans.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 4.9 GB | 8 GB | Önerilen |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Yüksek |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Orijinale yakın |
| F16 | 16 | 16.0 GB | 24 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.5 GB | ~5.4 GB |
| 8K token | ~1.0 GB | ~5.9 GB |
| 32K token | ~4.2 GB | ~9.1 GB |
| 128K token | ~16.8 GB | ~21.7 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run ministral-3:8b