← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить GPT-OSS 120B?

Модели GPT-OSS 120B от OpenAI нужно около 96 GB RAM при рекомендуемой 4-битной квантизации (загрузка 70.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~113 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

GPT-OSS 120B — это крупный релиз OpenAI с открытыми весами для тех, кому нужна chat- и reasoning-модель уровня frontier, работающая целиком на собственном железе. В основе лежит архитектура mixture-of-experts: при полном размере в 116.8B параметров на каждый токен активны лишь около 5.1B. Именно этот приём держит модель быстрой для её масштаба, но не обманывайтесь насчёт памяти — держать в RAM всё равно приходится всю модель целиком. При 4-битной квантизации это примерно 71 GB, и для комфортной работы желательно иметь около 96 GB системной памяти. Это точно не модель для ноутбучного GPU.

На практике это значит, что ни RTX 3060, ни даже 4090 её попросту не вместят, так что реальные варианты — это машина на Apple Silicon с большим объёмом памяти или CPU-сервер с большим RAM. На M-series Max можно рассчитывать примерно на 113 tok/s, что для модели такого размера ощущается по-настоящему отзывчиво. На CPU с DDR5 вы опускаетесь до примерно 16 tok/s — годится для пакетных задач, но медленно для интерактивного чата. Окно контекста в 128K щедрое, но его заполнение поднимает суммарную память примерно до 127 GB на максимальном контексте, так что закладывайте запас, а не считайте этот потолок своим обычным рабочим объёмом.

На фоне конкурентов GPT-OSS 120B сильно смещена в сторону чата и рассуждений, а не кода или работы с изображениями, поэтому что-то вроде Mistral Small 4 119B обычно даёт больше универсальности, если в том же объёме памяти вам нужен код или ввод картинок. Её младший собрат, GPT-OSS 20B, — это то, к чему стоит обратиться, когда 96 GB RAM недостижимы. Но главное преимущество здесь — лицензия: Apache 2.0 означает, что вы можете использовать модель коммерчески и в продакшене без каких-либо обязательств перед провайдером, что редкость на этом уровне возможностей и реальный повод выбрать именно её.

Характеристики

Параметры116.8B (5.1B активных)
Контекстное окно128K токенов
РазработчикOpenAI
ЛицензияApache 2.0
Дата выхода2025-08
Лучше всего дляЧат, Рассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3548.9 GB64 GBЗаметная потеря
Q4_K_MРекомендуется4.8570.8 GB96 GBРекомендуется
Q5_K_M5.6582.5 GB128 GBВысокое
Q8_08.5124.1 GB192 GBПочти оригинал
F1616233.6 GB256 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.8 GB~72.6 GB
8K токенов~3.5 GB~74.3 GB
32K токенов~14.0 GB~84.8 GB
128K токенов~56.1 GB~126.9 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~27 tok/s
Apple M-series Pro270 GB/s~74 tok/s
Apple M-series Max410 GB/s~113 tok/s
CPU only (dual-channel DDR5)60 GB/s~16 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run gpt-oss:120b

Частые вопросы

Могу ли я запустить GPT-OSS 120B? — Системные требования