← Tüm modellerMODEL TESTİ

GPT-OSS 120B çalıştırabilir miyim?

OpenAI imzalı GPT-OSS 120B, önerilen 4-bit nicemlemede yaklaşık 96 GB RAM ister (70.8 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~113 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

GPT-OSS 120B, ön cephe seviyesinde bir sohbet ve akıl yürütme modelini tamamen kendi donanımında çalıştırmak isteyenler için OpenAI'ın büyük açık ağırlıklı (open-weight) sürümü. Mixture-of-experts bir tasarım, yani model toplamda 116.8B parametre olsa da token başına yalnızca yaklaşık 5.1B parametre aktif oluyor. Boyutuna göre hızlı kalmasını sağlayan numara bu; ama bellek konusunda seni yanıltmasına izin verme: yine de tüm modeli RAM'de tutman gerekiyor. 4-bit niceleme (quant) ile bu kabaca 71 GB demek ve modeli rahatça çalıştırmak için sistemde 96 GB civarı bellek istiyorsun. Bu bir dizüstü GPU modeli değil.

Pratikte bu, bir RTX 3060'ın hatta 4090'ın bile modeli sığdıramayacağı anlamına geliyor; dolayısıyla gerçekçi adresler yüksek bellekli bir Apple Silicon makine ya da bol RAM'li bir CPU sistemi. M serisi Max üzerinde saniyede yaklaşık 113 token bekleyebilirsin ki bu boyutta bir model için gerçekten akıcı hissettiriyor. DDR5'li bir CPU'da ise saniyede yaklaşık 16 token'a düşersin; toplu (batch) işler için kullanılabilir ama etkileşimli sohbet için yavaş. 128K bağlam penceresi cömert, fakat onu doldurmak maksimum bağlamda toplam belleği kabaca 127 GB'a çıkarıyor; bu yüzden o tavanı normal çalışma boyutun gibi görmek yerine pay bırakacak şekilde planla.

Rakiplerine kıyasla GPT-OSS 120B kodlama veya görselden çok sohbet ve akıl yürütme tarafına yaslanıyor; yani aynı bellek ayak izinde kod veya görsel girdiye ihtiyacın varsa Mistral Small 4 119B gibi bir model genelde daha geniş bir kullanım yelpazesi sunar. Kendi küçük kardeşi GPT-OSS 20B ise 96 GB RAM söz konusu bile olamadığında başvurman gereken model. Buradaki asıl öne çıkan nokta lisans: Apache 2.0, modeli ticari olarak ve üretimde, sağlayıcıya bağlı hiçbir koşul olmadan kullanabileceğin anlamına geliyor; bu, bu yetenek sınıfında nadir görülen bir şey ve onu tercih etmek için gerçek bir sebep.

Teknik özellikler

Parametre116.8B (5.1B aktif)
Bağlam penceresi128K token
SağlayıcıOpenAI
LisansApache 2.0
Çıkış2025-08
En iyi olduğu alanSohbet, Akıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3548.9 GB64 GBBelirgin kayıp
Q4_K_MÖnerilen4.8570.8 GB96 GBÖnerilen
Q5_K_M5.6582.5 GB128 GBYüksek
Q8_08.5124.1 GB192 GBOrijinale yakın
F1616233.6 GB256 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.8 GB~72.6 GB
8K token~3.5 GB~74.3 GB
32K token~14.0 GB~84.8 GB
128K token~56.1 GB~126.9 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/sVRAM'e sığmaz
Apple M-series (base)100 GB/s~27 tok/s
Apple M-series Pro270 GB/s~74 tok/s
Apple M-series Max410 GB/s~113 tok/s
CPU only (dual-channel DDR5)60 GB/s~16 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gpt-oss:120b

Sık sorulan sorular