← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Gemma 4 E4B?

O Gemma 4 E4B, da Google, precisa de cerca de 8 GB de RAM na quantização recomendada de 4 bits (download de 4.9 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~112 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O Gemma 4 E4B é o modelo mixture-of-experts compacto do Google, e cai bem se você quer um assistente local que também lê imagens. O truque de um MoE é que só cerca de 4.5B dos seus 8B parâmetros são ativados por token, então ele roda na velocidade de um modelo bem menor, mas ainda precisa de espaço para o modelo inteiro na memória. Em 4 bits ele fica em torno de 4.9 GB, o que cabe numa placa de 12 GB como uma RTX 3060 com folga de sobra, e se encaixa tranquilamente na memória unificada de um Mac com Apple Silicon de 8 GB. Planeje para o modelo completo, não só para a fatia ativa.

No uso diário ele parece ágil. Numa RTX 3060 dá para esperar cerca de 112 tokens por segundo em 4 bits, e uma placa top de linha como a RTX 4090 leva isso para além de 300, mais rápido do que você consegue ler. No Apple Silicon, um M-Max fica perto de 128 tok/s, e até a CPU com DDR5 entrega uns 19 tok/s se você tiver paciência. A janela de contexto de 128K é real, mas custa caro: encha ela e a memória total sobe para cerca de 21.7 GB, bem acima do que só os pesos sugerem. Mantenha o contexto de trabalho em alguns milhares de tokens em hardware mais modesto e você fica confortável.

Frente ao Gemma 3 4B, o irmão mais leve da família, o E4B costuma entregar um resultado melhor mantendo uma pegada ativa igualmente pequena, e ambos lidam com visão, então ele é a escolha padrão mais acertada, a não ser que você esteja realmente sem memória. Seu ponto forte é justamente esse equilíbrio de velocidade e qualidade do MoE: chat e compreensão de imagens com a latência de um modelo pequeno. E a licença é a parte fácil. Apache 2.0 significa que você pode usá-lo livremente, inclusive comercialmente e em produção, sem amarras específicas do provedor. Isso faz dele um dos modelos locais mais simples para realmente colocar algo no ar.

Especificações

Parâmetros8B (4.5B ativos)
Janela de contexto128K tokens
FornecedorGoogle
LicençaApache 2.0
Lançamento2026-04
Ideal paraChat, Visão

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.353.4 GB6 GBPerda perceptível
Q4_K_MRecomendada4.854.9 GB8 GBRecomendada
Q5_K_M5.655.7 GB12 GBAlta
Q8_08.58.5 GB16 GBQuase original
F161616.0 GB24 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.5 GB~5.4 GB
8K tokens~1.0 GB~5.9 GB
32K tokens~4.2 GB~9.1 GB
128K tokens~16.8 GB~21.7 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~112 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~314 tok/s
Apple M-series (base)100 GB/s~31 tok/s
Apple M-series Pro270 GB/s~84 tok/s
Apple M-series Max410 GB/s~128 tok/s
CPU only (dual-channel DDR5)60 GB/s~19 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run gemma4:e4b

Perguntas frequentes