← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Nemotron 3 Super 120B-A12B?

O Nemotron 3 Super 120B-A12B, da NVIDIA, precisa de cerca de 96 GB de RAM na quantização recomendada de 4 bits (download de 72.8 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~48 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Nemotron 3 Super 120B-A12B é o modelo mixture-of-experts da NVIDIA para quem quer raciocínio e programação de ponta no próprio hardware e tem memória para sustentar isso. Apesar de carregar 120B de parâmetros totais, apenas 12B são ativados por token, então ele roda bem mais rápido do que o tamanho sugere, mas ainda exige espaço para o modelo inteiro. Esse é o detalhe: mesmo em quantização de 4 bits ele fica em torno de 72.8 GB, e você precisa de pelo menos 96 GB de RAM para carregá-lo. Não é um modelo para GPU de 8 GB. Uma RTX 4090 de 24 GB não dá conta dele, e nem a versão de 2 bits, em cerca de 50 GB, fica ao alcance. Uma máquina Apple Silicon com bastante memória unificada ou um servidor com muita RAM de sistema é o lar realista para ele.

No uso diário, o desenho MoE compensa. Em um Apple M Max você pode esperar cerca de 48 tokens por segundo, o que parece realmente interativo para chat, raciocínio em várias etapas e ajuda com código, apesar do rótulo de 120B. Rode na CPU com DDR5 e você cai para cerca de 7 tokens por segundo, utilizável para trabalho em lote, mas não para conversa ao vivo. A janela de contexto é enorme, com 1000K tokens, mas trate isso como um teto, não como um valor para deixar no máximo. Preencher mesmo 128K leva a memória total para aproximadamente 129.5 GB quando se conta o cache KV, então numa máquina de 96 GB você vai ficar sem folga muito antes de chegar ao limite anunciado. Mantenha o contexto de trabalho modesto, a menos que tenha memória de sobra.

Diante de seus parentes mais próximos, o Nemotron 3 Super está em companhia interessante. O Qwen 3.5 122B-A10B é um MoE de escala parecida que também lida com visão, o que este modelo não faz, então se você precisa de entrada de imagem aquele geralmente leva vantagem. O Mistral Small 4 119B é comparável em tamanho e também multimodal. Se o seu hardware não chega tão longe, o bem menor Nemotron 3 Nano 30B-A3B é a alternativa leve da mesma família e costuma ser a escolha pragmática em máquinas limitadas. O ponto forte do Super é entregar raciocínio na classe dos 120B com velocidade na classe dos 12B para quem consegue hospedá-lo. Um aviso: ele vem sob a licença NVIDIA Open Model, então confira esses termos antes de depender dele comercialmente, em vez de presumir liberdade plena de código aberto.

Especificações

Parâmetros120B (12B ativos)
Janela de contexto1M tokens
FornecedorNVIDIA
LicençaNVIDIA Open Model
Lançamento2026-03
Ideal paraChat, Raciocínio, Programação

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3550.3 GB96 GBPerda perceptível
Q4_K_MRecomendada4.8572.8 GB96 GBRecomendada
Q5_K_M5.6584.8 GB128 GBAlta
Q8_08.5127.5 GB192 GBQuase original
F1616240.0 GB256 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.8 GB~74.6 GB
8K tokens~3.5 GB~76.3 GB
32K tokens~14.2 GB~87.0 GB
128K tokens~56.7 GB~129.5 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/sNão cabe na VRAM
Apple M-series (base)100 GB/s~12 tok/s
Apple M-series Pro270 GB/s~32 tok/s
Apple M-series Max410 GB/s~48 tok/s
CPU only (dual-channel DDR5)60 GB/s~7 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run nemotron-3-super:120b

Perguntas frequentes

Requisitos de sistema do Nemotron 3 Super 120B-A12B — Posso rodar localmente?