← Tüm modellerMODEL TESTİ

GPT-OSS 20B çalıştırabilir miyim?

OpenAI imzalı GPT-OSS 20B, önerilen 4-bit nicemlemede yaklaşık 24 GB RAM ister (12.7 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~160 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

GPT-OSS 20B, OpenAI'nin açık ağırlıklı reasoning modeli; anlaman gereken en kritik şey ise bunun bir mixture-of-experts olması: 20.9B toplam parametrenin yalnızca 3.6B'si her token için aktif oluyor. Bu da modeli yoğun (dense) bir 20B modele göre çok daha hızlı çalıştırıyor, ama yine de tamamını bellekte tutmak zorundasın. 4-bit niceleme (quant) ile boyut yaklaşık 12.7 GB'a oturuyor ve pratikte alt sınır 24 GB civarı RAM. RTX 3060 gibi 12 GB'lık bir karta sığmıyor; yani gerçekçi olarak ya 4090 gibi 24 GB'lık bir GPU'ya ya da bol unified bellekli bir Apple Silicon Mac'e bakıyorsun.

Günlük kullanımda boyutuna göre hızlı hissettiriyor; MoE'nin asıl getirisi de bu. RTX 4090 üzerinde saniyede yaklaşık 393 token, M serisi Max çipte ise kabaca 160 tok/s bekleyebilirsin; ikisi de okuma hızının epey üzerinde. DDR5'te yalnızca CPU ile bu rakam yaklaşık 23 tok/s'ye düşüyor; toplu (batch) işler için kullanılabilir ama interaktif sohbet için değil. 128K bağlam penceresi cömert, ancak sessizce belleği yiyen kısım tam da bu: tamamını doldurduğunda KV cache yüklendikten sonra toplam kullanım yaklaşık 38.5 GB'a tırmanıyor. Yedek alanın yoksa çalışma bağlamını ölçülü tut ya da 8.8 GB'a yakın q2 sürümüne in.

Kodlamadan çok sohbet ve reasoning için tasarlanmış; dolayısıyla programlama işlerinde Codestral 22B gibi bir model genelde sana daha iyi hizmet eder, görme (vision) de istiyorsan tercih Mistral Small 3.1 24B olur. Öne çıkan özelliği, 3.6B aktif parametre maliyetiyle sunduğu reasoning kalitesi; daha fazla alana ihtiyacın varsa büyük kardeşi GPT-OSS 120B aynı reçeteyi yukarı ölçekliyor. Lisansı Apache 2.0, yani sağlayıcıya özgü hiçbir bağlayıcı koşul olmadan, ticari kullanım ve production dahil gerçekten özgürce kullanabilirsin.

Teknik özellikler

Parametre20.9B (3.6B aktif)
Bağlam penceresi128K token
SağlayıcıOpenAI
LisansApache 2.0
Çıkış2025-08
En iyi olduğu alanSohbet, Akıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.358.8 GB16 GBBelirgin kayıp
Q4_K_MÖnerilen4.8512.7 GB24 GBÖnerilen
Q5_K_M5.6514.8 GB24 GBYüksek
Q8_08.522.2 GB32 GBOrijinale yakın
F161641.8 GB64 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~0.8 GB~13.5 GB
8K token~1.6 GB~14.3 GB
32K token~6.5 GB~19.2 GB
128K token~25.8 GB~38.5 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run gpt-oss:20b

Sık sorulan sorular