Posso rodar o Gemma 3 4B?
O Gemma 3 4B, da Google, precisa de cerca de 6 GB de RAM na quantização recomendada de 4 bits (download de 2.6 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~117 tok/s em um NVIDIA RTX 3060 12GB.
Lendo os sinais do seu hardware…
Notas do mundo real
O Gemma 3 4B é o pequeno cavalo de batalha do Google para quem quer um assistente local competente que também entende imagens. Com 4.3B de parâmetros, ele rende mais do que se espera de um modelo 4B, e a pegada é minúscula: um quant de 4 bits ocupa cerca de 2.6 GB, e você só precisa de uns 6 GB de RAM para rodá-lo. Ou seja, ele cabe em quase qualquer coisa que tenha sinais de vida: uma GPU de notebook antiga de 8 GB, um Mac Apple Silicon básico, até uma RTX 3060 de 12 GB com sobra. Se você quer visão mais chat sem precisar de uma máquina parruda, este é o ponto de partida óbvio.
No dia a dia ele parece rápido. Numa RTX 3060 dá para esperar cerca de 117 tokens por segundo em 4 bits, e numa RTX 4090 sobe para uns 329, então as respostas saem mais rápido do que você consegue ler em qualquer uma das duas. Um Apple M Max fica perto de 134 tok/s, e até CPU puro em DDR5 dá conta de uns 20, o que é utilizável para prompts curtos. A janela de contexto de 128K é real, mas cara: preencha ela por completo e a memória total sobe para cerca de 15.3 GB, então numa GPU pequena mantenha seu contexto de trabalho em alguns milhares de tokens ou desça para um quant menor.
Contra o Qwen 3 4B, a troca honesta é clara: o Qwen 3 geralmente leva a melhor em raciocínio e tarefas estruturadas de várias etapas, enquanto o destaque do Gemma 3 4B é a visão. Poucos modelos tão pequenos realmente leem imagens, e só isso já faz dele a escolha quando você precisa de um modelo multimodal local em hardware modesto. Se ele ficar pequeno para você, o Gemma 3 12B é o passo natural na mesma família. Uma ressalva: a licença Gemma é de pesos abertos, não de código aberto, e traz os próprios termos de uso do Google, então leia-os antes de embarcá-lo em um produto.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.8 GB | 4 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 2.6 GB | 6 GB | Recomendada |
| Q5_K_M | 5.65 | 3.0 GB | 6 GB | Alta |
| Q8_0 | 8.5 | 4.6 GB | 8 GB | Quase original |
| F16 | 16 | 8.6 GB | 16 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.4 GB | ~3.0 GB |
| 8K tokens | ~0.8 GB | ~3.4 GB |
| 32K tokens | ~3.2 GB | ~5.8 GB |
| 128K tokens | ~12.7 GB | ~15.3 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~117 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~329 tok/s |
| Apple M-series (base) | 100 GB/s | ~33 tok/s |
| Apple M-series Pro | 270 GB/s | ~88 tok/s |
| Apple M-series Max | 410 GB/s | ~134 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~20 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run gemma3Fontes e downloads