← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить OLMo 2 13B?

Модели OLMo 2 13B от Ai2 нужно около 12 GB RAM при рекомендуемой 4-битной квантизации (загрузка 8.3 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~37 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

OLMo 2 13B — полностью открытая чат-модель от Ai2, и её главная ценность не только в качестве, но и в прозрачности: веса, обучающие данные и весь рецепт опубликованы под Apache 2.0, поэтому её можно без оговорок использовать в коммерческих проектах. В 4-битной квантизации модель занимает около 8.3 GB — для карты на 12 GB это многовато с учётом накладных расходов, но на GPU с 16 GB или в общей памяти Mac на Apple Silicon она помещается свободно. Если памяти в обрез, 2-битная сборка ужимается примерно до 5.7 GB. Закладывайте как минимум 12 GB RAM.

В повседневной работе это надёжный, уравновешенный собеседник. На RTX 3060 12 GB в 4-битном режиме можно рассчитывать примерно на 37 tok/s — заметно быстрее, чем вы читаете, а 4090 разгоняет до примерно 103 tok/s. M-series Max держится около 42 tok/s. Единственное, о чём стоит помнить постоянно, — контекстное окно всего 4K, что по меркам 2024–2025 годов очень мало. Даже при полной загрузке модель занимает лишь около 9 GB суммарно, но скормить ей длинные документы или объёмную историю чата без обрезки попросту не получится, так что относитесь к ней как к ассистенту для коротких сессий.

В своём весовом классе OLMo 2 13B — выбор ради открытых данных, а не лидер по чистым возможностям. Модели вроде Qwen 3 14B и Phi-4 14B обычно обходят её в рассуждениях и структурированных задачах, и обе несут куда более крупные контекстные окна, если вам важны длинные входные данные. Ministral 3 14B добавляет работу с изображениями, которой у OLMo нет. Зато OLMo даёт то, чего нет ни у одной из них, — настоящую сквозную открытость: если вам важно точно знать, что заложено в модель, или вы занимаетесь исследованиями и воспроизводимостью, обращайтесь именно к ней. Apache 2.0 означает отсутствие каких-либо ограничений на использование.

Характеристики

Параметры13.7B
Контекстное окно4K токенов
РазработчикAi2
ЛицензияApache 2.0
Дата выхода2024-11
Лучше всего дляЧат

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.355.7 GB12 GBЗаметная потеря
Q4_K_MРекомендуется4.858.3 GB12 GBРекомендуется
Q5_K_M5.659.7 GB16 GBВысокое
Q8_08.514.6 GB24 GBПочти оригинал
F161627.4 GB48 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.7 GB~9.0 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~37 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~103 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~28 tok/s
Apple M-series Max410 GB/s~42 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run olmo2:13b

Частые вопросы

Могу ли я запустить OLMo 2 13B? — Системные требования