← Tüm modellerMODEL TESTİ

Mistral Small 4 119B çalıştırabilir miyim?

Mistral AI imzalı Mistral Small 4 119B, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (72.1 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~88 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Mistral Small 4 119B bu ailenin tuhaf üyesi: adında "small" geçiyor ama toplamda 119B parametre taşıyan bir mixture-of-experts ve her token için yalnızca 6.5B'lik kısmı aktif ediyor. Hıza göre boyutunun üzerinde performans vermesinin sebebi tam da bu tasarım, ama bellekte modelin tamamının bedelini yine de ödüyorsunuz. 4-bit'te yaklaşık 72 GB'a oturuyor ve onu bellekte tutmak için kabaca 96 GB RAM gerekiyor. Hiçbir tüketici GPU'su bu modeli almıyor: 12 GB'lık RTX 3060 de, hatta 24 GB'lık RTX 4090 da yetersiz kalıyor. Bu bir iş istasyonu ya da büyük unified-memory makine modeli, dizüstü tercihi değil.

Günlük kullanımda MoE numarası asıl önemli olan yerde işe yarıyor. Yüksek bellekli bir Apple M Max üzerinde saniyede yaklaşık 88 token üretiyor; bu kadar büyük bir model için sohbet temposunda hissettiren bir hız bu. Sabırlıysanız DDR5 ile CPU'da bile saniyede yaklaşık 13 token alıyorsunuz. 256K bağlam kâğıt üzerinde cömert görünüyor ama belleğe dikkat: 128K bağlamda toplam ayak izi yaklaşık 128.6 GB'a tırmanıyor, yani uzun pencere ancak onu kaldıracak RAM'iniz varsa gerçek oluyor. Tam bağlamı ücretsiz bir ayar değil, bir donanım bütçesi sorusu olarak ele alın.

Kendi soyu içinde, 96 GB'ı besleyemiyorsanız Mistral 7B ve Nemo 12B sadece-sohbet odaklı hafif seçenekler; bu model ise genellikle akıl yürütme, kodlama ve görüde öne çıkıyor — ki o ikisi bunları hiç yapmıyor. Buradaki en yakın rakibi, aynı ağırlık sınıfındaki bir başka büyük MoE olan Nemotron 3 Super 120B-A12B; ikisi de net bir lider çıkarmak yerine karşılıklı puan alıp veriyor. Asıl öne çıkan nokta şu: gerçek bir Apache 2.0 lisansı altında dört görevli bir model (chat, reasoning, coding, vision) elde ediyorsunuz, yani ticari ve üretim kullanımı hiçbir sağlayıcı şartına takılmadan tamamen serbest.

Teknik özellikler

Parametre119B (6.5B aktif)
Bağlam penceresi256K token
SağlayıcıMistral AI
LisansApache 2.0
Çıkış2026-03
En iyi olduğu alanSohbet, Akıl yürütme, Kodlama, Görüntü

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3549.8 GB64 GBBelirgin kayıp
Q4_K_MÖnerilen4.8572.1 GB96 GBÖnerilen
Q5_K_M5.6584.0 GB128 GBYüksek
Q8_08.5126.4 GB192 GBOrijinale yakın
F1616238.0 GB256 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.8 GB~73.9 GB
8K token~3.5 GB~75.6 GB
32K token~14.1 GB~86.2 GB
128K token~56.5 GB~128.6 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/sVRAM'e sığmaz
Apple M-series (base)100 GB/s~22 tok/s
Apple M-series Pro270 GB/s~58 tok/s
Apple M-series Max410 GB/s~88 tok/s
CPU only (dual-channel DDR5)60 GB/s~13 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Sık sorulan sorular

Mistral Small 4 119B Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?