← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить GPT-OSS 20B?

Модели GPT-OSS 20B от OpenAI нужно около 24 GB RAM при рекомендуемой 4-битной квантизации (загрузка 12.7 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~160 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

GPT-OSS 20B — это open-weight модель рассуждений от OpenAI, и главное, что нужно понимать: это mixture-of-experts. Из 20.9B параметров на каждый токен активируется лишь 3.6B. Поэтому она работает заметно быстрее, чем плотная модель на 20B, но держать в памяти всё равно приходится всю модель целиком. В 4-битной квантизации это около 12.7 GB, а практический минимум — примерно 24 GB RAM. На карту с 12 GB вроде RTX 3060 она не помещается, так что реально нужен GPU на 24 GB, например 4090, либо Mac на Apple Silicon с большим объёмом unified-памяти.

В повседневной работе для своего размера она ощущается шустрой — это и есть выигрыш от MoE. На RTX 4090 можно рассчитывать примерно на 393 tok/s, на чипе M-серии Max — около 160 tok/s, и то и другое заметно выше скорости чтения. Только на CPU с DDR5 скорость падает примерно до 23 tok/s: годится для пакетных задач, но не для интерактивного чата. Окно контекста в 128K щедрое, но именно оно незаметно съедает память: заполните его полностью — и общее потребление вырастает примерно до 38.5 GB, когда загружен KV-кэш. Держите рабочий контекст умеренным, если нет запаса, или переходите на сборку q2 около 8.8 GB.

Модель заточена под чат и рассуждения, а не под код, поэтому для программирования обычно лучше подойдёт что-то вроде Codestral 22B, а Mistral Small 3.1 24B — выбор, если вам нужно ещё и зрение. Её сильная сторона — качество рассуждений при затратах всего в 3.6B активных параметров, а если нужен запас побольше, старший вариант GPT-OSS 120B масштабирует тот же рецепт. Лицензия — Apache 2.0, так что модель действительно свободна в использовании, в том числе коммерчески и в продакшене, без привязки к конкретному провайдеру.

Характеристики

Параметры20.9B (3.6B активных)
Контекстное окно128K токенов
РазработчикOpenAI
ЛицензияApache 2.0
Дата выхода2025-08
Лучше всего дляЧат, Рассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.358.8 GB16 GBЗаметная потеря
Q4_K_MРекомендуется4.8512.7 GB24 GBРекомендуется
Q5_K_M5.6514.8 GB24 GBВысокое
Q8_08.522.2 GB32 GBПочти оригинал
F161641.8 GB64 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.8 GB~13.5 GB
8K токенов~1.6 GB~14.3 GB
32K токенов~6.5 GB~19.2 GB
128K токенов~25.8 GB~38.5 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run gpt-oss:20b

Частые вопросы

Могу ли я запустить GPT-OSS 20B? — Системные требования