← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen 3 0.6B?

O Qwen 3 0.6B, da Alibaba, precisa de cerca de 2 GB de RAM na quantização recomendada de 4 bits (download de 0.4 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~841 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen 3 0.6B é um modelo realmente minúsculo, e é justamente esse o objetivo. Em 4-bit ele ocupa cerca de 0.4 GB, e mesmo uma versão q8 fica em apenas 0.6 GB, então cabe em 2 GB de RAM com folga. Isso significa que ele roda praticamente em qualquer coisa: um notebook antigo, uma placa do tipo Raspberry Pi, um celular ou um cantinho de qualquer GPU moderna. Encare-o como o modelo que você escolhe quando quer geração de texto local em hardware que não tinha a menor chance de rodar um LLM, e não como um assistente que faz de tudo.

No dia a dia, o destaque é a velocidade pura. Numa RTX 3060 ele entrega cerca de 841 tok/s, um M-series Max fica perto de 958 tok/s, e uma 4090 chega a aproximadamente 2355 tok/s, muito mais rápido do que você consegue ler e veloz o bastante para embutir em loops apertados ou tarefas em lote. Mesmo numa CPU com DDR5 você obtém cerca de 140 tok/s, perfeitamente utilizável. A janela de contexto de 32K é real, e como o modelo todo permanece pequeno, um contexto de 32K totalmente carregado precisa de apenas cerca de 1.7 GB no total, então aqui você raramente precisa se preocupar com a pressão da KV-cache.

Seja honesto consigo mesmo sobre o trade-off: com 0.6B de parâmetros, ele é um modelo de chat, não de raciocínio. Para qualquer coisa multi-etapas, estruturada ou pesada em código, o Qwen 3 4B da mesma família geralmente sai bem na frente, e até o Qwen 3 1.7B costuma seguir instruções de forma mais confiável. Contra o Gemma 3 1B ele é a opção mais leve e rápida, embora os dois fiquem em território parecido para chat simples. Sua verdadeira vantagem é o tamanho aliado à velocidade, e a licença ajuda: Apache 2.0 significa que você pode usá-lo livremente, inclusive comercialmente, sem amarras específicas do provedor.

Especificações

Parâmetros0.6B
Janela de contexto32K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2025-04
Ideal paraChat

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.350.3 GB2 GBPerda perceptível
Q4_K_MRecomendada4.850.4 GB2 GBRecomendada
Q5_K_M5.650.4 GB2 GBAlta
Q8_08.50.6 GB3 GBQuase original
F16161.2 GB3 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.2 GB~0.6 GB
8K tokens~0.3 GB~0.7 GB
32K tokens~1.3 GB~1.7 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~841 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~2355 tok/s
Apple M-series (base)100 GB/s~234 tok/s
Apple M-series Pro270 GB/s~631 tok/s
Apple M-series Max410 GB/s~958 tok/s
CPU only (dual-channel DDR5)60 GB/s~140 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3:0.6b

Perguntas frequentes