Magistral Small 1.2 çalıştırabilir miyim?
Mistral AI imzalı Magistral Small 1.2, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (14.6 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~24 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Magistral Small 1.2, Mistral'in 24B parametreli akıl yürütme modeli; sadece sohbet etmek yerine çok adımlı problemleri gerçekten düşünerek çözen yerel bir asistan isteyenlere hitap ediyor. Görüntü işleme ve genel sohbeti de yapıyor, ama ona uzanmanın asıl sebebi akıl yürütme. İlk planlamanız gereken şey bellek ayak izi: 4-bit quant ile yaklaşık 14.6 GB'a iniyor ve rahat çalıştırmak için kabaca 24 GB belleğe ihtiyacınız var. Bu da RTX 3060 gibi 12 GB'lık bir kartı devre dışı bırakıyor; oraya hiç sığmıyor. Sizi 24 GB'lık bir GPU'ya ya da yüksek bellekli bir Apple Silicon Mac'e yönlendiriyor.
RTX 4090 üzerinde saniyede yaklaşık 59 token hızında akıyor; bu, adım adım akıl yürütmesinin asla bekleme gibi hissettirmeyeceği kadar hızlı. M serisi Max'te saniyede 24 token'a daha yakınsınız, interaktif iş için hâlâ gayet kullanışlı; DDR5 üzerinde yalnızca CPU ile ise saniyede yaklaşık 4 token'a düşüyor, toplu işler için uygun ama canlı sohbet için değil. 128K bağlam gerçek, ama belleğe aç: doldurun, toplam kullanım kabaca 42.1 GB'a tırmanıyor; bu da tek bir 24 GB'lık kartın taşıyabileceğinin hayli ötesinde. Bol bellek yedeğiniz yoksa çalışma bağlamını mütevazı tutun.
Kardeşleriyle kıyaslarsak, ağırlıklı olarak sohbet istiyor ve belleği esirgeyemiyorsanız Mistral Nemo 12B daha hafif ve hızlı tercih; Gemma 4 26B A4B ise benzer boyutta akıl yürütme, kodlama ve görüntü işlemede genelde daha doğrudan rakip. Magistral'in öne çıkan özelliği, tamamen sahibi olabileceğiniz bir modelde bu akıl yürütme odağı: Apache 2.0 lisansı, sağlayıcıya bağlı hiçbir koşul olmadan ticari olarak ve üretimde kullanabileceğiniz anlamına geliyor ki bu, yetenekli bir 24B akıl yürütücü için nadir bir şey. Onu beslemeye 24 GB'ınız varsa, mevcut yerel düşünme modellerinin en ciddilerinden biri.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 14.6 GB | 24 GB | Önerilen |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Yüksek |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Orijinale yakın |
| F16 | 16 | 48.0 GB | 64 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.9 GB | ~15.5 GB |
| 8K token | ~1.7 GB | ~16.3 GB |
| 32K token | ~6.9 GB | ~21.5 GB |
| 128K token | ~27.5 GB | ~42.1 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.