Posso rodar o OLMo 2 13B?
O OLMo 2 13B, da Ai2, precisa de cerca de 12 GB de RAM na quantização recomendada de 4 bits (download de 8.3 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~37 tok/s em um NVIDIA RTX 3060 12GB.
Lendo os sinais do seu hardware…
Notas do mundo real
O OLMo 2 13B é o modelo de chat totalmente aberto da Ai2, e seu apelo tem tanto a ver com procedência quanto com desempenho: os pesos, os dados de treinamento e a receita são todos públicos sob a Apache 2.0, então você pode usá-lo comercialmente sem ficar em dúvida sobre os termos. Em quantização de 4-bit ele fica em torno de 8.3 GB, um pouco demais para uma placa de 12 GB depois de contar o overhead, mas roda tranquilo numa GPU de 16 GB ou na memória unificada de um Mac com Apple Silicon. Se o espaço estiver apertado, a build de 2-bit cai para cerca de 5.7 GB. Conte com uns 12 GB de RAM como piso.
No uso diário, ele se comporta como um parceiro de chat sólido e equilibrado. Numa RTX 3060 12 GB dá para esperar cerca de 37 tokens por segundo em 4-bit, confortavelmente mais rápido do que você lê, e uma 4090 leva isso a uns 103 tok/s. Um chip M-series Max fica perto de 42 tok/s. O ponto que você precisa ter sempre em mente é a janela de contexto de 4K, pequena para os padrões de 2024-2025. Mesmo no limite o modelo precisa de apenas uns 9 GB no total, mas você simplesmente não consegue alimentá-lo com documentos longos ou históricos de conversa extensos sem truncar, então trate-o como um assistente de turnos curtos.
Dentro da sua faixa de tamanho, o OLMo 2 13B é a escolha de dados abertos, não o líder em capacidade bruta. Modelos como o Qwen 3 14B e o Phi-4 14B geralmente o superam em raciocínio e tarefas estruturadas, e ambos trazem janelas de contexto bem maiores, caso entradas longas sejam importantes para você. O Ministral 3 14B adiciona visão, algo que o OLMo não tem. O que o OLMo oferece e nenhum deles oferece é abertura genuína de ponta a ponta: se você se importa em saber exatamente o que entrou no seu modelo, ou faz trabalho de pesquisa e reprodutibilidade, é este que você deve procurar. Apache 2.0 significa nenhuma amarra de uso.
Especificações
Tamanho por quantização
| Quantização | Bits/peso | Download | RAM mínima | Qualidade |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.7 GB | 12 GB | Perda perceptível |
| Q4_K_MRecomendada | 4.85 | 8.3 GB | 12 GB | Recomendada |
| Q5_K_M | 5.65 | 9.7 GB | 16 GB | Alta |
| Q8_0 | 8.5 | 14.6 GB | 24 GB | Quase original |
| F16 | 16 | 27.4 GB | 48 GB | Original |
Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →
Memória necessária por tamanho de contexto
| Contexto | Cache KV (est.) | Memória total (Q4) |
|---|---|---|
| 4K tokens | ~0.7 GB | ~9.0 GB |
O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.
Velocidade estimada por hardware
| Hardware | Largura de banda | ~Velocidade |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~37 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~103 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~28 tok/s |
| Apple M-series Max | 410 GB/s | ~42 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.
Rode localmente
O caminho mais fácil é o Ollama — um comando e você já está conversando:
ollama run olmo2:13bFontes e downloads