OLMo 2 13B çalıştırabilir miyim?
Ai2 imzalı OLMo 2 13B, önerilen 4-bit nicemlemede yaklaşık 12 GB RAM ister (8.3 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. NVIDIA RTX 3060 12GB üzerinde yaklaşık ~37 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
OLMo 2 13B, Ai2'nin tamamen açık sohbet modeli; cazibesi performans kadar köken şeffaflığından da geliyor: ağırlıklar, eğitim verisi ve eğitim reçetesinin tamamı Apache 2.0 altında herkese açık, yani lisans koşullarını sorgulamadan ticari olarak kullanabilirsin. 4-bit niceleme (quant) ile boyut yaklaşık 8.3 GB; ek yükü de hesaba katınca 12 GB'lık bir kart için biraz fazla, ama 16 GB'lık bir GPU'da ya da Apple Silicon Mac'in birleşik belleğinde rahatça çalışır. Yerin darsa 2-bit sürümü yaklaşık 5.7 GB'a düşer. Taban olarak kabaca 12 GB RAM hesaba katmalısın.
Günlük kullanımda sağlam, dengeli bir sohbet partneri gibi hissettiriyor. RTX 3060 12 GB üzerinde 4-bit ile saniyede yaklaşık 37 token bekleyebilirsin; bu okuma hızının rahatça üzerinde. RTX 4090 ise bunu yaklaşık 103 tok/s'ye çıkarır. M serisi Max ise 42 tok/s civarında oturur. Akılda tutulması gereken tek nokta 4K bağlam penceresi; bu da 2024-2025 standartlarına göre küçük. Sonuna kadar doldurulsa bile model toplamda yalnızca yaklaşık 9 GB'a ihtiyaç duyar, ama uzun belgeleri veya dağınık sohbet geçmişlerini kırpmadan besleyemezsin; bu yüzden onu kısa turlu bir asistan olarak düşün.
Kendi boyut sınıfında OLMo 2 13B, ham yetenekte lider olmaktan çok açık-veri tercihidir. Qwen 3 14B ve Phi-4 14B gibi modeller akıl yürütme ve yapılandırılmış görevlerde genellikle onun bir adım önündedir; ayrıca uzun girdiler senin için önemliyse her ikisi de çok daha geniş bağlam penceresi sunar. Ministral 3 14B görüntü (vision) desteği de ekler, OLMo bunu yapmaz. OLMo'nun bunların hiçbirinde olmayan sunduğu şey ise gerçek uçtan uca açıklıktır: modelinin içine tam olarak neyin girdiğini bilmek istiyorsan ya da araştırma ve tekrarlanabilirlik (reproducibility) çalışması yapıyorsan, başvuracağın model budur. Apache 2.0 ise hiçbir kullanım kısıtı olmaması demek.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.7 GB | 12 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 8.3 GB | 12 GB | Önerilen |
| Q5_K_M | 5.65 | 9.7 GB | 16 GB | Yüksek |
| Q8_0 | 8.5 | 14.6 GB | 24 GB | Orijinale yakın |
| F16 | 16 | 27.4 GB | 48 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~0.7 GB | ~9.0 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~37 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~103 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~28 tok/s |
| Apple M-series Max | 410 GB/s | ~42 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run olmo2:13b