Posso rodar o GPT-OSS 120B?
O GPT-OSS 120B, da OpenAI, precisa de cerca de 96 GB de RAM na quantização recomendada de 4 bits (download de 70.8 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~113 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O GPT-OSS 120B é o grande lançamento de pesos abertos da OpenAI para quem quer rodar um modelo de chat e raciocínio de nível de fronteira inteiramente no próprio hardware. É um design mixture-of-experts, então, embora o modelo completo tenha 116.8B de parâmetros, só cerca de 5.1B ficam ativos por token. Esse é o truque que o mantém rápido para o tamanho que tem, mas não se engane quanto à memória: você ainda precisa manter tudo na RAM. Em um quant de 4 bits, isso dá uns 71 GB, e você vai querer por volta de 96 GB de memória de sistema para rodá-lo com folga. Este não é um modelo para GPU de notebook.
Na prática, isso significa que uma RTX 3060 ou até uma 4090 simplesmente não dão conta dele, então os lares realistas são uma máquina Apple Silicon com bastante memória ou um servidor de CPU com muita RAM. Em um M-series Max, dá para esperar cerca de 113 tokens por segundo, o que parece de fato ágil para um modelo deste porte. Na CPU com DDR5, você cai para uns 16 tokens por segundo, utilizável para trabalho em lote, mas lento para chat interativo. A janela de contexto de 128K é generosa, mas preenchê-la empurra a memória total para uns 127 GB no contexto máximo, então planeje com folga em vez de tratar esse teto como seu tamanho de trabalho normal.
Frente aos concorrentes, o GPT-OSS 120B pende bastante para chat e raciocínio, em vez de programação ou visão, então algo como o Mistral Small 4 119B geralmente oferece mais alcance se você precisar de código ou entrada de imagem no mesmo espaço. Seu irmãozinho, o GPT-OSS 20B, é o que vale a pena buscar quando 96 GB de RAM estão fora de cogitação. O destaque aqui é a licença: Apache 2.0 significa que você pode usá-lo comercialmente e em produção sem nenhuma amarra do provedor, algo raro nesse nível de capacidade e um motivo de verdade para escolhê-lo.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 48.9 GB | 64 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 70.8 GB | 96 GB | Recomendada |
| Q5_K_M | 5.65 | 82.5 GB | 128 GB | Alta |
| Q8_0 | 8.5 | 124.1 GB | 192 GB | Quase original |
| F16 | 16 | 233.6 GB | 256 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~1.8 GB | ~72.6 GB |
| 8K tokens | ~3.5 GB | ~74.3 GB |
| 32K tokens | ~14.0 GB | ~84.8 GB |
| 128K tokens | ~56.1 GB | ~126.9 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Não cabe na VRAM |
| Apple M-series (base) | 100 GB/s | ~27 tok/s |
| Apple M-series Pro | 270 GB/s | ~74 tok/s |
| Apple M-series Max | 410 GB/s | ~113 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~16 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run gpt-oss:120bFontes e downloads