← Tüm modellerMODEL TESTİ

GLM-4.6V-Flash çalıştırabilir miyim?

Z.ai imzalı GLM-4.6V-Flash, önerilen 4-bit nicemlemede yaklaşık 12 GB RAM ister (5.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~56 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

GLM-4.6V-Flash, Z.ai'nin 9B'lik bir görsel-ve-sohbet (vision + chat) modeli; sadece metin okuyan değil, görselleri gerçekten inceleyebilen yerel bir asistan isteyenlere yönelik. 4-bit nicelemede yaklaşık 5.5 GB yer kaplıyor, dolayısıyla RTX 3060 gibi 12 GB'lik bir karta bol bol sığıyor ve makul donanımlı herhangi bir Apple Silicon Mac'in birleşik belleğine de oturuyor. Rahatça yüklemek için isteyeceğiniz minimum değer 12 GB civarı RAM. Yeriniz darsa 2-bit derleme kabaca 3.8 GB'a kadar düşüyor, ama bu rahatlığın bedelini kaliteden ödüyorsunuz.

Günlük kullanımda hızlı hissettiriyor. RTX 3060 üzerinde 4-bit'te saniyede yaklaşık 56 token bekleyebilirsiniz; bu, yanıtların okuma hızınızın önünden akmasına yetecek kadar hızlı, elinizde bir 4090 varsa bu rakam yaklaşık 157 tok/s'ye çıkıyor. M serisi bir Max 64 tok/s dolaylarında, DDR5 üzerinde salt CPU ise yaklaşık 9 tok/s'de sürünüyor; ancak sabırlıysanız kullanılabilir. 128K bağlam gerçek ama pahalı: bunu doldurmak toplam belleği 23.2 GB'a doğru itiyor, ki bu 12 GB'lik bir kartın tutabileceğinin epey ötesi. Bu yüzden çalışma bağlamını ölçülü tutun ve devasa belgeler yerine görsel görevlere yaslanın.

Kardeşleri arasında görsel tarafta bariz kıyas noktası Qwen 2.5 VL 7B ve genelde iyi dayanıyor; görsellerin yanında akıl yürütme de istiyorsanız Qwen 3.5 9B genellikle daha güçlü tercih oluyor. GLM-4.6V-Flash'ın öne çıkan özelliği, mütevazı donanımda fazla zahmetsiz çalışan, gerçekten kompakt bir çok-kipli (multimodal) model olması. Lisansı MIT; bu da onu sağlayıcının hiçbir bağlayıcı şartı olmadan ticari olarak ve üretimde özgürce kullanabileceğiniz anlamına geliyor; birçok açık ağırlıklı sürüme karşı gerçek bir avantaj.

Teknik özellikler

Parametre9B
Bağlam penceresi128K token
SağlayıcıZ.ai
LisansMIT
Çıkış2025-12
En iyi olduğu alanGörüntü, Sohbet

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.353.8 GB8 GBBelirgin kayıp
Q4_K_MÖnerilen4.855.5 GB12 GBÖnerilen
Q5_K_M5.656.4 GB12 GBYüksek
Q8_08.59.6 GB16 GBOrijinale yakın
F161618.0 GB24 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.6 GB~6.1 GB
8K token~1.1 GB~6.6 GB
32K token~4.4 GB~9.9 GB
128K token~17.7 GB~23.2 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/s~56 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~157 tok/s
Apple M-series (base)100 GB/s~16 tok/s
Apple M-series Pro270 GB/s~42 tok/s
Apple M-series Max410 GB/s~64 tok/s
CPU only (dual-channel DDR5)60 GB/s~9 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Sık sorulan sorular

GLM-4.6V-Flash Sistem Gereksinimleri — Yerel Çalıştırabilir miyim?