← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o Qwen3-VL 32B?

O Qwen3-VL 32B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 20.0 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~17 tok/s em um Apple M-series Max.

Lendo os sinais do seu hardware…

Notas do mundo real

O Qwen3-VL 32B é o modelo de visão e raciocínio da Alibaba para quem quer um assistente local capaz de realmente olhar imagens, não só ler texto. Com 33B de parâmetros densos, ele exige bem mais que os modelos iniciais de 7-8B: um quant de 4-bit fica em torno de 20 GB, e você precisa de pelo menos 32 GB de RAM de sistema para acomodar o modelo inteiro com folga. Isso descarta uma placa de 12 GB como a RTX 3060, onde ele simplesmente não cabe. Na prática, é caso para uma GPU de 24 GB ou uma máquina Apple Silicon bem equipada, não um notebook qualquer.

No dia a dia ele parece competente, mas comedido em vez de ágil. Numa RTX 4090, espere algo em torno de 43 tokens por segundo em 4-bit, rápido o bastante para chat confortável e perguntas sobre imagens; num Mac M-Max fica mais perto de 17 tokens por segundo, usável, mas mais lento do que você gostaria em sessões longas, e só com CPU, a cerca de 3 tokens por segundo, é último recurso. A janela de contexto de 256K é generosa, mas a memória cresce rápido com ela: mesmo em 128K, o consumo total sobe para cerca de 51.7 GB, então planeje manter o contexto de trabalho modesto a menos que tenha sobra de memória.

Contra o EXAONE 4.5 33B, o rival óbvio do mesmo tamanho que também faz visão e raciocínio, os dois ficam parelhos e a escolha acaba dependendo do ferramental e de qual ecossistema você já confia; a força do Qwen3-VL é uma família madura e amplamente suportada, com um pull fácil no Ollama via qwen3-vl:32b. Seu grande diferencial é um raciocínio multimodal genuinamente forte num tamanho que você ainda consegue hospedar por conta própria numa única GPU. E o licenciamento é a parte fácil: Apache 2.0 significa que você pode usá-lo livremente, inclusive em trabalho comercial e em produção, sem amarras específicas do provedor.

Especificações

Parâmetros33B
Janela de contexto256K tokens
FornecedorAlibaba
LicençaApache 2.0
Lançamento2025-10
Ideal paraVisão, Chat, Raciocínio

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.3513.8 GB24 GBPerda perceptível
Q4_K_MRecomendada4.8520.0 GB32 GBRecomendada
Q5_K_M5.6523.3 GB32 GBAlta
Q8_08.535.1 GB48 GBQuase original
F161666.0 GB96 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~1.0 GB~21.0 GB
8K tokens~2.0 GB~22.0 GB
32K tokens~7.9 GB~27.9 GB
128K tokens~31.7 GB~51.7 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/sNão cabe na VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~11 tok/s
Apple M-series Max410 GB/s~17 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run qwen3-vl:32b

Perguntas frequentes