Mistral Small 3.1 24B çalıştırabilir miyim?
Mistral AI imzalı Mistral Small 3.1 24B, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (14.6 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~24 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Mistral Small 3.1 24B, 8B'lik bir modelin zor promptlarda sizi sürekli hayal kırıklığına uğrattığı ama 70B'ye çıkmak istemediğiniz noktada uzanacağınız model. 24B'lik bir sohbet ve görü (vision) modeli, yani metnin yanında görselleri de okuyor; üstelik Apache 2.0 lisansıyla geliyor, bu da hiçbir kısıtlama olmadan ticari olarak ve production'da kullanabileceğiniz anlamına geliyor. İşin püf noktası ise bellek ayak izi: 4-bit niceleme (quant) ile yaklaşık 14.6 GB'a oturuyor ve rahat çalıştırmak için kabaca 24 GB belleğe ihtiyacınız var. Bu, RTX 3060 gibi 12 GB'lik bir kartı devre dışı bırakıyor; oraya basitçe sığmıyor. Sizi 24 GB'lik bir GPU'ya ya da bol unified bellekli bir Apple Silicon Mac'e yönlendiriyor.
RTX 4090 gibi 24 GB'lik bir kartta 4-bit ile saniyede yaklaşık 59 token hızında ilerliyor; bu sizin okuma hızınızdan daha hızlı akıyor ve bu boyutta bir model için gerçekten çevik hissettiriyor. M-series Max üzerinde saniyede 24 token'a daha yakın bir hız söz konusu, interaktif sohbet için hâlâ gayet kullanılabilir. DDR5 ile yalnızca CPU'da hız saniyede yaklaşık 4 token'a düşüyor; gece boyunca sürecek bir batch işi için uygun ama başında oturup beklemek için değil. 128K bağlam penceresi gerçek, ama pahalı: pencereyi sonuna kadar doldurun, toplam bellek yaklaşık 42 GB'a tırmanıyor; bu da modelin kısa bağlamda ihtiyaç duyduğunun çok ötesinde. Bu yüzden bol yeriniz yoksa çalışma bağlamını ölçülü tutun.
Kendi ailesi içinde ağır siklet olan o: bellek kısıtlıysanız Mistral Nemo 12B daha hafif ve hızlı tercih, Mistral 7B ise en alt seviyedeki seçenek; ama ikisi de zor muhakeme ve talimat takibinde Small 3.1'in seviyesine ulaşamıyor. Ham yetenek açısından en yakın rakip Gemma 4 26B A4B; ayrıca kodlama ve muhakeme alanlarında güçlü, dolayısıyla bu işler sizin için en önemliyse ikisini karşılaştırın. Small 3.1'in öne çıkan özelliği, nadiren bir arada bulduğunuz şu üçlü: yerleşik görü (vision), uzun bağlam ve tamamen serbest Apache 2.0 lisansı. Bu da onu bir üründe gerçekten devreye almanın en kolay olduğu yetenekli modellerden biri yapıyor.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 14.6 GB | 24 GB | Önerilen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Yüksek |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 48.0 GB | 64 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.9 GB | ~15.5 GB |
| 8K token | ~1.7 GB | ~16.3 GB |
| 32K token | ~6.9 GB | ~21.5 GB |
| 128K token | ~27.5 GB | ~42.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run mistral-small3.1Kaynaklar ve indirme