Posso rodar o SmolLM2 1.7B?
O SmolLM2 1.7B, da Hugging Face, precisa de cerca de 3 GB de RAM na quantização recomendada de 4 bits (download de 1.0 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~297 tok/s em um NVIDIA RTX 3060 12GB.
Lendo os sinais do seu hardware…
Notas do mundo real
O SmolLM2 1.7B é para aquele cenário em que o Llama 8B é exagero: um modelo de chat realmente minúsculo que você roda em quase qualquer lugar. Em 4-bit ele ocupa cerca de 1 GB, e você só precisa de uns 3 GB de RAM para carregá-lo com espaço de trabalho, então ele roda num Mac M1 básico, num notebook de entrada, numa plaquinha tipo Raspberry Pi ou em qualquer celular moderno com folga. A licença é Apache 2.0, o que significa que você pode usá-lo comercialmente e em produção sem amarras do provedor. Pense nele como o modelo que você embarca, não aquele com quem você fica conversando o dia inteiro.
No dia a dia, o destaque é o throughput bruto. Numa RTX 3060 ele roda por volta de 297 tokens por segundo, um M Max chega a uns 338, e uma 4090 atinge cerca de 831, muito mais rápido do que você consegue ler. Mesmo numa CPU DDR5 comum ele entrega uns 49 tokens por segundo, perfeitamente usável para respostas curtas sem GPU alguma. O limite real é a janela de contexto de 8K. É pequena para os padrões atuais, então serve bem para perguntas isoladas, classificação e resumos curtos, mas não vai segurar um documento longo. Memória aqui não é problema: mesmo preenchendo todos os 8K, o total chega a apenas cerca de 1.5 GB.
Seja honesto sobre o que 1.7B entrega. Ele dá conta de chat leve, formatação e instruções simples, mas fica devendo em raciocínio de múltiplas etapas e tarefas de código mais longas. O Qwen 3 1.7B geralmente leva vantagem em prompts mais difíceis e estruturados, e o DeepSeek R1 1.5B costuma se sair melhor quando você realmente precisa de raciocínio em cadeia (chain-of-thought) em vez de respostas rápidas. Frente ao Llama 3.2 1B, ele troca um pouco de peso extra por uma saída mais estável. Sua marca registrada é a eficiência: um assistente totalmente aberto e de uso comercial que roda rápido em hardware que nada tão capaz quanto ele alcança. Recorra a ele quando o tamanho importa mais que a profundidade.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 1.0 GB | 3 GB | Recomendada |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Alta |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Quase original |
| F16 | 16 | 3.4 GB | 6 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.3 GB | ~1.3 GB |
| 8K tokens | ~0.5 GB | ~1.5 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run smollm2