← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o GPT-OSS 20B?

O GPT-OSS 20B, da OpenAI, precisa de cerca de 24 GB de RAM na quantização recomendada de 4 bits (download de 12.7 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~160 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O GPT-OSS 20B é o modelo de raciocínio open-weight da OpenAI, e o ponto-chave para entender é que ele é um mixture-of-experts: dos seus 20.9B de parâmetros totais, apenas 3.6B são ativados por token. Isso significa que ele roda muito mais rápido do que um modelo denso de 20B rodaria, mas você ainda precisa manter o modelo inteiro na memória. Em um quant de 4 bits ele fica em torno de 12.7 GB, e o piso prático é de cerca de 24 GB de RAM. Ele não cabe em uma placa de 12 GB como a RTX 3060, então, na prática, você vai precisar de uma GPU de 24 GB como a 4090, ou um Mac com Apple Silicon e bastante memória unificada.

No uso diário ele parece ágil para o tamanho que tem, que é justamente o ganho do MoE. Em uma RTX 4090 você pode esperar cerca de 393 tokens por segundo, e em um chip da linha M-series Max algo em torno de 160 tok/s, ambos bem acima da velocidade de leitura. Só com CPU em DDR5 a taxa cai para uns 23 tok/s, o que serve para tarefas em lote, mas não para chat interativo. A janela de contexto de 128K é generosa, mas é justamente a parte que consome memória de forma silenciosa: encha ela por completo e o uso total sobe para cerca de 38.5 GB depois que o KV cache é carregado. Mantenha o contexto de trabalho modesto, a menos que tenha folga de sobra, ou troque para o build q2, perto de 8.8 GB.

Ele foi feito para chat e raciocínio, e não para programação, então, para trabalho de código, algo como o Codestral 22B geralmente atende melhor, e o Mistral Small 3.1 24B é a escolha se você também quiser visão. Seu grande diferencial é a qualidade de raciocínio a um custo de apenas 3.6B parâmetros ativos, e, se quiser mais folga, o irmão maior GPT-OSS 120B escala a mesma receita para cima. A licença é Apache 2.0, então ele é realmente livre para usar, inclusive comercialmente e em produção, sem amarras específicas do provedor.

Especificações

Parâmetros20.9B (3.6B ativos)
Janela de contexto128K tokens
FornecedorOpenAI
LicençaApache 2.0
Lançamento2025-08
Ideal paraChat, Raciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.358.8 GB16 GBPerda perceptível
Q4_K_MRecomendada4.8512.7 GB24 GBRecomendada
Q5_K_M5.6514.8 GB24 GBAlta
Q8_08.522.2 GB32 GBQuase original
F161641.8 GB64 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.8 GB~13.5 GB
8K tokens~1.6 GB~14.3 GB
32K tokens~6.5 GB~19.2 GB
128K tokens~25.8 GB~38.5 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run gpt-oss:20b

Perguntas frequentes

Requisitos de sistema do GPT-OSS 20B — Posso rodar localmente?