← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить DeepSeek R1 14B?

Модели DeepSeek R1 14B от DeepSeek нужно около 16 GB RAM при рекомендуемой 4-битной квантизации (загрузка 9.0 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~34 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

DeepSeek R1 14B — это модель для рассуждений, а не собеседник для быстрого чата. С 14.8B параметров она попадает в неудобную середину: 4-битный квант весит около 9 GB, что выходит за пределы карты на 12 GB, как только добавляешь контекст, а рекомендуемый минимум — 16 GB RAM. Она спокойно работает на GPU с 24 GB вроде RTX 4090 или на Apple Silicon Mac с большим объёмом памяти, но на RTX 3060 с 12 GB вы на самой грани. Лицензия MIT — это самое простое: свободное использование, в том числе коммерческое, без каких-либо ограничений со стороны провайдера.

В повседневной работе она «думает вслух» перед ответом, так что готовьтесь к длинным цепочкам токенов рассуждений на каждый запрос. На RTX 4090 вы получаете около 95 tok/s — достаточно быстро, чтобы рассуждения проносились на экране; на RTX 3060 скорость падает примерно до 34 tok/s, а на Mac с M-Max — около 39 tok/s, где эти длинные трассы уже начинают ощущаться медленными. Контекст 128K реален, но дорог: его заполнение поднимает суммарную память примерно до 31.1 GB, далеко за пределы любой конфигурации на 16 GB, поэтому держите рабочий контекст скромным, если у вас нет машины с 32 GB и больше.

По сравнению с Qwen 3 14B, у которой такие же 14.8B параметров, но которая справляется и с обычным чатом, R1 14B — более узкоспециализированный выбор: она обычно выигрывает на многошаговой математике и логике, но кажется громоздкой для простого диалога, где Qwen, как правило, быстрее и прямее. Её главная сильная сторона — прозрачные рассуждения в размере, который реально развернуть у себя. Если хочется того же подхода, но легче, DeepSeek R1 7B урезает количество параметров примерно вдвое и комфортнее помещается на карту с 12 GB.

Характеристики

Параметры14.8B
Контекстное окно128K токенов
РазработчикDeepSeek
ЛицензияMIT
Дата выхода2025-01
Лучше всего дляРассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.356.2 GB12 GBЗаметная потеря
Q4_K_MРекомендуется4.859.0 GB16 GBРекомендуется
Q5_K_M5.6510.5 GB16 GBВысокое
Q8_08.515.7 GB24 GBПочти оригинал
F161629.6 GB48 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.7 GB~9.7 GB
8K токенов~1.4 GB~10.4 GB
32K токенов~5.5 GB~14.5 GB
128K токенов~22.1 GB~31.1 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~34 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~95 tok/s
Apple M-series (base)100 GB/s~9 tok/s
Apple M-series Pro270 GB/s~26 tok/s
Apple M-series Max410 GB/s~39 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run deepseek-r1:14b

Частые вопросы