GPT-OSS 120B çalıştırabilir miyim?
OpenAI imzalı GPT-OSS 120B, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (70.8 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~113 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
GPT-OSS 120B, ön cephe seviyesinde bir sohbet ve akıl yürütme modelini tamamen kendi donanımında çalıştırmak isteyenler için OpenAI'ın büyük açık ağırlıklı (open-weight) sürümü. Mixture-of-experts bir tasarım, yani model toplamda 116.8B parametre olsa da token başına yalnızca yaklaşık 5.1B parametre aktif oluyor. Boyutuna göre hızlı kalmasını sağlayan numara bu; ama bellek konusunda seni yanıltmasına izin verme: yine de tüm modeli RAM'de tutman gerekiyor. 4-bit niceleme (quant) ile bu kabaca 71 GB demek ve modeli rahatça çalıştırmak için sistemde 96 GB civarı bellek istiyorsun. Bu bir dizüstü GPU modeli değil.
Pratikte bu, bir RTX 3060'ın hatta 4090'ın bile modeli sığdıramayacağı anlamına geliyor; dolayısıyla gerçekçi adresler yüksek bellekli bir Apple Silicon makine ya da bol RAM'li bir CPU sistemi. M serisi Max üzerinde saniyede yaklaşık 113 token bekleyebilirsin ki bu boyutta bir model için gerçekten akıcı hissettiriyor. DDR5'li bir CPU'da ise saniyede yaklaşık 16 token'a düşersin; toplu (batch) işler için kullanılabilir ama etkileşimli sohbet için yavaş. 128K bağlam penceresi cömert, fakat onu doldurmak maksimum bağlamda toplam belleği kabaca 127 GB'a çıkarıyor; bu yüzden o tavanı normal çalışma boyutun gibi görmek yerine pay bırakacak şekilde planla.
Rakiplerine kıyasla GPT-OSS 120B kodlama veya görselden çok sohbet ve akıl yürütme tarafına yaslanıyor; yani aynı bellek ayak izinde kod veya görsel girdiye ihtiyacın varsa Mistral Small 4 119B gibi bir model genelde daha geniş bir kullanım yelpazesi sunar. Kendi küçük kardeşi GPT-OSS 20B ise 96 GB RAM söz konusu bile olamadığında başvurman gereken model. Buradaki asıl öne çıkan nokta lisans: Apache 2.0, modeli ticari olarak ve üretimde, sağlayıcıya bağlı hiçbir koşul olmadan kullanabileceğin anlamına geliyor; bu, bu yetenek sınıfında nadir görülen bir şey ve onu tercih etmek için gerçek bir sebep.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 48.9 GB | 64 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 70.8 GB | 96 GB | Önerilen |
| Q5_K_M | 5.65 | 82.5 GB | 128 GB | Yüksek |
| Q8_0 | 8.5 | 124.1 GB | 192 GB | Orijinale yakın |
| F16 | 16 | 233.6 GB | 256 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.8 GB | ~72.6 GB |
| 8K token | ~3.5 GB | ~74.3 GB |
| 32K token | ~14.0 GB | ~84.8 GB |
| 128K token | ~56.1 GB | ~126.9 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | VRAM'e sığmaz |
| Apple M-series (base) | 100 GB/s | ~27 tok/s |
| Apple M-series Pro | 270 GB/s | ~74 tok/s |
| Apple M-series Max | 410 GB/s | ~113 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~16 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run gpt-oss:120bKaynaklar ve indirme