Могу ли я запустить GPT-OSS 120B?
Модели GPT-OSS 120B от OpenAI нужно около 96 GB RAM при рекомендуемой 4-битной квантизации (загрузка 70.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~113 tok/s на Apple M-series Max.
Считываем характеристики вашего железа…
Заметки из практики
GPT-OSS 120B — это крупный релиз OpenAI с открытыми весами для тех, кому нужна chat- и reasoning-модель уровня frontier, работающая целиком на собственном железе. В основе лежит архитектура mixture-of-experts: при полном размере в 116.8B параметров на каждый токен активны лишь около 5.1B. Именно этот приём держит модель быстрой для её масштаба, но не обманывайтесь насчёт памяти — держать в RAM всё равно приходится всю модель целиком. При 4-битной квантизации это примерно 71 GB, и для комфортной работы желательно иметь около 96 GB системной памяти. Это точно не модель для ноутбучного GPU.
На практике это значит, что ни RTX 3060, ни даже 4090 её попросту не вместят, так что реальные варианты — это машина на Apple Silicon с большим объёмом памяти или CPU-сервер с большим RAM. На M-series Max можно рассчитывать примерно на 113 tok/s, что для модели такого размера ощущается по-настоящему отзывчиво. На CPU с DDR5 вы опускаетесь до примерно 16 tok/s — годится для пакетных задач, но медленно для интерактивного чата. Окно контекста в 128K щедрое, но его заполнение поднимает суммарную память примерно до 127 GB на максимальном контексте, так что закладывайте запас, а не считайте этот потолок своим обычным рабочим объёмом.
На фоне конкурентов GPT-OSS 120B сильно смещена в сторону чата и рассуждений, а не кода или работы с изображениями, поэтому что-то вроде Mistral Small 4 119B обычно даёт больше универсальности, если в том же объёме памяти вам нужен код или ввод картинок. Её младший собрат, GPT-OSS 20B, — это то, к чему стоит обратиться, когда 96 GB RAM недостижимы. Но главное преимущество здесь — лицензия: Apache 2.0 означает, что вы можете использовать модель коммерчески и в продакшене без каких-либо обязательств перед провайдером, что редкость на этом уровне возможностей и реальный повод выбрать именно её.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 48.9 GB | 64 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 70.8 GB | 96 GB | Рекомендуется |
| Q5_K_M | 5.65 | 82.5 GB | 128 GB | Высокое |
| Q8_0 | 8.5 | 124.1 GB | 192 GB | Почти оригинал |
| F16 | 16 | 233.6 GB | 256 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~1.8 GB | ~72.6 GB |
| 8K токенов | ~3.5 GB | ~74.3 GB |
| 32K токенов | ~14.0 GB | ~84.8 GB |
| 128K токенов | ~56.1 GB | ~126.9 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Не поместится в VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Не поместится в VRAM |
| Apple M-series (base) | 100 GB/s | ~27 tok/s |
| Apple M-series Pro | 270 GB/s | ~74 tok/s |
| Apple M-series Max | 410 GB/s | ~113 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~16 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run gpt-oss:120bИсточники и загрузки
Ollama Library
Скачайте и запустите модель одной командой.
ollama.comHugging Face
Веса модели, файлы и подробности лицензии.
huggingface.coОфициальный репозиторий на GitHub
Исходный код, релизы и issues от OpenAI.
github.comOpenAI — официальная страница
Официальная страница и документация от OpenAI.
openai.com