Posso rodar o Magistral Small 1.2?
O Magistral Small 1.2, da Mistral AI, precisa de cerca de 24 GB de RAM na quantização recomendada de 4 bits (download de 14.6 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~24 tok/s em um Apple M-series Max.
Lendo os sinais do seu hardware…
Notas do mundo real
O Magistral Small 1.2 é o modelo de raciocínio de 24B da Mistral, voltado para quem quer um assistente local que realmente pense em problemas de múltiplas etapas, em vez de só conversar. Ele também lida com visão e conversa geral, mas o raciocínio é o motivo de escolhê-lo. O primeiro ponto a planejar é o tamanho na memória: em quantização de 4 bits ele fica perto de 14.6 GB, e você precisa de cerca de 24 GB de memória para rodá-lo com folga. Isso elimina uma placa de 12 GB como a RTX 3060, onde ele simplesmente não cabe, e aponta para uma GPU de 24 GB ou um Mac Apple Silicon com mais memória.
Numa RTX 4090 ele gera por volta de 59 tokens por segundo, rápido o suficiente para que o raciocínio passo a passo nunca pareça espera. Num M-series Max você fica mais perto de 24 tokens por segundo, ainda perfeitamente usável para trabalho interativo, e só com CPU em DDR5 cai para cerca de 4 tokens por segundo, ok para tarefas em lote, mas não para chat ao vivo. O contexto de 128K é real, mas consome bastante memória: preencha-o e o uso total sobe para cerca de 42 GB, bem além do que uma única placa de 24 GB comporta, então mantenha o contexto de trabalho modesto a menos que você tenha sobra.
Entre seus irmãos, o Mistral Nemo 12B é a escolha mais leve e rápida se você quer principalmente chat e não pode gastar tanta memória, enquanto o Gemma 4 26B A4B costuma competir mais diretamente em raciocínio, código e visão num tamanho parecido. O grande diferencial do Magistral é esse foco em raciocínio num modelo que você pode possuir por completo: a licença Apache 2.0 significa que você pode usá-lo comercialmente e em produção, sem amarras do provedor, algo raro para um modelo de raciocínio de 24B competente. Se você tem os 24 GB para alimentá-lo, ele é um dos modelos de raciocínio local mais sérios disponíveis.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 10.1 GB | 16 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 14.6 GB | 24 GB | Recomendada |
| Q5_K_M | 5.65 | 17.0 GB | 24 GB | Alta |
| Q8_0 | 8.5 | 25.5 GB | 48 GB | Quase original |
| F16 | 16 | 48.0 GB | 64 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.9 GB | ~15.5 GB |
| 8K tokens | ~1.7 GB | ~16.3 GB |
| 32K tokens | ~6.9 GB | ~21.5 GB |
| 128K tokens | ~27.5 GB | ~42.1 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Não cabe na VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~59 tok/s |
| Apple M-series (base) | 100 GB/s | ~6 tok/s |
| Apple M-series Pro | 270 GB/s | ~16 tok/s |
| Apple M-series Max | 410 GB/s | ~24 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~4 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.