← Todos os modelosVERIFICAÇÃO DE MODELO

Posso rodar o OLMo 2 13B?

O OLMo 2 13B, da Ai2, precisa de cerca de 12 GB de RAM na quantização recomendada de 4 bits (download de 8.3 GB). Seu hardware é verificado abaixo — na hora, nada sai do seu navegador. Espere cerca de ~37 tok/s em um NVIDIA RTX 3060 12GB.

Lendo os sinais do seu hardware…

Notas do mundo real

O OLMo 2 13B é o modelo de chat totalmente aberto da Ai2, e seu apelo tem tanto a ver com procedência quanto com desempenho: os pesos, os dados de treinamento e a receita são todos públicos sob a Apache 2.0, então você pode usá-lo comercialmente sem ficar em dúvida sobre os termos. Em quantização de 4-bit ele fica em torno de 8.3 GB, um pouco demais para uma placa de 12 GB depois de contar o overhead, mas roda tranquilo numa GPU de 16 GB ou na memória unificada de um Mac com Apple Silicon. Se o espaço estiver apertado, a build de 2-bit cai para cerca de 5.7 GB. Conte com uns 12 GB de RAM como piso.

No uso diário, ele se comporta como um parceiro de chat sólido e equilibrado. Numa RTX 3060 12 GB dá para esperar cerca de 37 tokens por segundo em 4-bit, confortavelmente mais rápido do que você lê, e uma 4090 leva isso a uns 103 tok/s. Um chip M-series Max fica perto de 42 tok/s. O ponto que você precisa ter sempre em mente é a janela de contexto de 4K, pequena para os padrões de 2024-2025. Mesmo no limite o modelo precisa de apenas uns 9 GB no total, mas você simplesmente não consegue alimentá-lo com documentos longos ou históricos de conversa extensos sem truncar, então trate-o como um assistente de turnos curtos.

Dentro da sua faixa de tamanho, o OLMo 2 13B é a escolha de dados abertos, não o líder em capacidade bruta. Modelos como o Qwen 3 14B e o Phi-4 14B geralmente o superam em raciocínio e tarefas estruturadas, e ambos trazem janelas de contexto bem maiores, caso entradas longas sejam importantes para você. O Ministral 3 14B adiciona visão, algo que o OLMo não tem. O que o OLMo oferece e nenhum deles oferece é abertura genuína de ponta a ponta: se você se importa em saber exatamente o que entrou no seu modelo, ou faz trabalho de pesquisa e reprodutibilidade, é este que você deve procurar. Apache 2.0 significa nenhuma amarra de uso.

Especificações

Parâmetros13.7B
Janela de contexto4K tokens
FornecedorAi2
LicençaApache 2.0
Lançamento2024-11
Ideal paraChat

Tamanho por quantização

QuantizaçãoBits/pesoDownloadRAM mínimaQualidade
Q2_K3.355.7 GB12 GBPerda perceptível
Q4_K_MRecomendada4.858.3 GB12 GBRecomendada
Q5_K_M5.659.7 GB16 GBAlta
Q8_08.514.6 GB24 GBQuase original
F161627.4 GB48 GBOriginal

Os tamanhos são estimativas de número de parâmetros × bits por peso; builds GGUF reais variam um pouco. · Dados atualizados: 2026-06-11 · Como calculamos esses números →

Memória necessária por tamanho de contexto

ContextoCache KV (est.)Memória total (Q4)
4K tokens~0.7 GB~9.0 GB

O cache KV cresce com o tamanho do contexto — um modelo que cabe em 4K pode ficar sem memória em 32K. As estimativas assumem cache em FP16 com grouped-query attention; o uso real varia conforme o runtime.

Velocidade estimada por hardware

HardwareLargura de banda~Velocidade
NVIDIA RTX 3060 12GB360 GB/s~37 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~103 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~28 tok/s
Apple M-series Max410 GB/s~42 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

A geração de tokens é limitada pela largura de banda da memória: tok/s ≈ largura de banda × 0,85 ÷ tamanho do modelo em Q4. Os números reais variam conforme o runtime e o tamanho do contexto.

Rode localmente

O caminho mais fácil é o Ollama — um comando e você já está conversando:

ollama run olmo2:13b

Perguntas frequentes