← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o GPT-OSS 120B?

O GPT-OSS 120B, da OpenAI, precisa de cerca de 96 GB de RAM na quantização recomendada de 4 bits (download de 70.8 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~113 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O GPT-OSS 120B é o grande lançamento de pesos abertos da OpenAI para quem quer rodar um modelo de chat e raciocínio de nível de fronteira inteiramente no próprio hardware. É um design mixture-of-experts, então, embora o modelo completo tenha 116.8B de parâmetros, só cerca de 5.1B ficam ativos por token. Esse é o truque que o mantém rápido para o tamanho que tem, mas não se engane quanto à memória: você ainda precisa manter tudo na RAM. Em um quant de 4 bits, isso dá uns 71 GB, e você vai querer por volta de 96 GB de memória de sistema para rodá-lo com folga. Este não é um modelo para GPU de notebook.

Na prática, isso significa que uma RTX 3060 ou até uma 4090 simplesmente não dão conta dele, então os lares realistas são uma máquina Apple Silicon com bastante memória ou um servidor de CPU com muita RAM. Em um M-series Max, dá para esperar cerca de 113 tokens por segundo, o que parece de fato ágil para um modelo deste porte. Na CPU com DDR5, você cai para uns 16 tokens por segundo, utilizável para trabalho em lote, mas lento para chat interativo. A janela de contexto de 128K é generosa, mas preenchê-la empurra a memória total para uns 127 GB no contexto máximo, então planeje com folga em vez de tratar esse teto como seu tamanho de trabalho normal.

Frente aos concorrentes, o GPT-OSS 120B pende bastante para chat e raciocínio, em vez de programação ou visão, então algo como o Mistral Small 4 119B geralmente oferece mais alcance se você precisar de código ou entrada de imagem no mesmo espaço. Seu irmãozinho, o GPT-OSS 20B, é o que vale a pena buscar quando 96 GB de RAM estão fora de cogitação. O destaque aqui é a licença: Apache 2.0 significa que você pode usá-lo comercialmente e em produção sem nenhuma amarra do provedor, algo raro nesse nível de capacidade e um motivo de verdade para escolhê-lo.

Especificações

Parâmetros116.8B (5.1B ativos)
Janela de contexto128K tokens
FornecedorOpenAI
LicençaApache 2.0
Lançamento2025-08
Ideal paraChat, Raciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3548.9 GB64 GBPerda perceptível
Q4_K_MRecomendada4.8570.8 GB96 GBRecomendada
Q5_K_M5.6582.5 GB128 GBAlta
Q8_08.5124.1 GB192 GBQuase original
F1616233.6 GB256 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.8 GB~72.6 GB
8K tokens~3.5 GB~74.3 GB
32K tokens~14.0 GB~84.8 GB
128K tokens~56.1 GB~126.9 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/sNão cabe na VRAM
Apple M-series (base)100 GB/s~27 tok/s
Apple M-series Pro270 GB/s~74 tok/s
Apple M-series Max410 GB/s~113 tok/s
CPU only (dual-channel DDR5)60 GB/s~16 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run gpt-oss:120b

Perguntas frequentes

Requisitos de sistema do GPT-OSS 120B — Posso rodar localmente?