Могу ли я запустить OLMo 2 13B?
Модели OLMo 2 13B от Ai2 нужно около 12 GB RAM при рекомендуемой 4-битной квантизации (загрузка 8.3 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~37 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
OLMo 2 13B — полностью открытая чат-модель от Ai2, и её главная ценность не только в качестве, но и в прозрачности: веса, обучающие данные и весь рецепт опубликованы под Apache 2.0, поэтому её можно без оговорок использовать в коммерческих проектах. В 4-битной квантизации модель занимает около 8.3 GB — для карты на 12 GB это многовато с учётом накладных расходов, но на GPU с 16 GB или в общей памяти Mac на Apple Silicon она помещается свободно. Если памяти в обрез, 2-битная сборка ужимается примерно до 5.7 GB. Закладывайте как минимум 12 GB RAM.
В повседневной работе это надёжный, уравновешенный собеседник. На RTX 3060 12 GB в 4-битном режиме можно рассчитывать примерно на 37 tok/s — заметно быстрее, чем вы читаете, а 4090 разгоняет до примерно 103 tok/s. M-series Max держится около 42 tok/s. Единственное, о чём стоит помнить постоянно, — контекстное окно всего 4K, что по меркам 2024–2025 годов очень мало. Даже при полной загрузке модель занимает лишь около 9 GB суммарно, но скормить ей длинные документы или объёмную историю чата без обрезки попросту не получится, так что относитесь к ней как к ассистенту для коротких сессий.
В своём весовом классе OLMo 2 13B — выбор ради открытых данных, а не лидер по чистым возможностям. Модели вроде Qwen 3 14B и Phi-4 14B обычно обходят её в рассуждениях и структурированных задачах, и обе несут куда более крупные контекстные окна, если вам важны длинные входные данные. Ministral 3 14B добавляет работу с изображениями, которой у OLMo нет. Зато OLMo даёт то, чего нет ни у одной из них, — настоящую сквозную открытость: если вам важно точно знать, что заложено в модель, или вы занимаетесь исследованиями и воспроизводимостью, обращайтесь именно к ней. Apache 2.0 означает отсутствие каких-либо ограничений на использование.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.7 GB | 12 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 8.3 GB | 12 GB | Рекомендуется |
| Q5_K_M | 5.65 | 9.7 GB | 16 GB | Высокое |
| Q8_0 | 8.5 | 14.6 GB | 24 GB | Почти оригинал |
| F16 | 16 | 27.4 GB | 48 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.7 GB | ~9.0 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~37 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~103 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~28 tok/s |
| Apple M-series Max | 410 GB/s | ~42 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run olmo2:13bИсточники и загрузки