Posso rodar o Qwen3-VL 32B?
O Qwen3-VL 32B, da Alibaba, precisa de cerca de 32 GB de RAM na quantização recomendada de 4 bits (download de 20.0 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~17 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O Qwen3-VL 32B é o modelo de visão e raciocínio da Alibaba para quem quer um assistente local capaz de realmente olhar imagens, não só ler texto. Com 33B de parâmetros densos, ele exige bem mais que os modelos iniciais de 7-8B: um quant de 4-bit fica em torno de 20 GB, e você precisa de pelo menos 32 GB de RAM de sistema para acomodar o modelo inteiro com folga. Isso descarta uma placa de 12 GB como a RTX 3060, onde ele simplesmente não cabe. Na prática, é caso para uma GPU de 24 GB ou uma máquina Apple Silicon bem equipada, não um notebook qualquer.
No dia a dia ele parece competente, mas comedido em vez de ágil. Numa RTX 4090, espere algo em torno de 43 tokens por segundo em 4-bit, rápido o bastante para chat confortável e perguntas sobre imagens; num Mac M-Max fica mais perto de 17 tokens por segundo, usável, mas mais lento do que você gostaria em sessões longas, e só com CPU, a cerca de 3 tokens por segundo, é último recurso. A janela de contexto de 256K é generosa, mas a memória cresce rápido com ela: mesmo em 128K, o consumo total sobe para cerca de 51.7 GB, então planeje manter o contexto de trabalho modesto a menos que tenha sobra de memória.
Contra o EXAONE 4.5 33B, o rival óbvio do mesmo tamanho que também faz visão e raciocínio, os dois ficam parelhos e a escolha acaba dependendo do ferramental e de qual ecossistema você já confia; a força do Qwen3-VL é uma família madura e amplamente suportada, com um pull fácil no Ollama via qwen3-vl:32b. Seu grande diferencial é um raciocínio multimodal genuinamente forte num tamanho que você ainda consegue hospedar por conta própria numa única GPU. E o licenciamento é a parte fácil: Apache 2.0 significa que você pode usá-lo livremente, inclusive em trabalho comercial e em produção, sem amarras específicas do provedor.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.8 GB | 24 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 20.0 GB | 32 GB | Recomendada |
| Q5_K_M | 5.65 | 23.3 GB | 32 GB | Alta |
| Q8_0 | 8.5 | 35.1 GB | 48 GB | Quase original |
| F16 | 16 | 66.0 GB | 96 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~21.0 GB |
| 8K tokens | ~2.0 GB | ~22.0 GB |
| 32K tokens | ~7.9 GB | ~27.9 GB |
| 128K tokens | ~31.7 GB | ~51.7 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~17 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run qwen3-vl:32bFontes e downloads