← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить DeepSeek R1 7B?

Модели DeepSeek R1 7B от DeepSeek нужно около 8 GB RAM при рекомендуемой 4-битной квантизации (загрузка 4.6 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~66 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

DeepSeek R1 7B — это модель с упором на рассуждения: она построена так, чтобы разбирать задачу пошагово, а не просто поддерживать диалог. В 4-битной квантизации она занимает около 4.6 GB, поэтому помещается на видеокарту с 8 GB и укладывается в общую память любого Mac на Apple Silicon. Заявленный минимум — 8 GB RAM, что делает её одной из самых доступных reasoning-моделей для self-hosting. Если вам нужен локальный ассистент, который показывает ход решения на математике, логике и многошаговых вопросах, а не угадывает ответ, это разумный выбор на 7.6B параметров.

В повседневной работе главная особенность — именно стиль рассуждений: модель выписывает цепочку мыслей перед финальным ответом. Это расходует токены, но на сложных запросах обычно даёт более надёжный результат. Скорость для такой нагрузки комфортная. На RTX 3060 12GB можно рассчитывать примерно на 66 tok/s, а M-серия Max выдаёт около 76 tok/s — достаточно быстро, чтобы видимое «размышление» не воспринималось как ожидание. Контекст 128K реален, но дорог: если заполнить его целиком, суммарная память вырастает примерно до 21 GB, что заметно выходит за пределы карты на 8 GB. Так что держите рабочий контекст скромным, если у вас нет видеокарты на 24 GB.

Если говорить честно, модель жертвует гладкостью обычного чата ради вдумчивости, и если ваша работа в основном про код, вам, как правило, лучше подойдёт Qwen 2.5 Coder 7B того же размера. Её сильная сторона — рассуждения по умолчанию в объёме, который реально тянут небольшие машины; когда её возможностей перестанет хватать, естественный следующий шаг — DeepSeek R1 8B. Лицензия — MIT, так что вы свободно можете использовать модель в коммерческих целях и в продакшене без специфичных для провайдера ограничений, что редкость для модели такого уровня.

Характеристики

Параметры7.6B
Контекстное окно128K токенов
РазработчикDeepSeek
ЛицензияMIT
Дата выхода2025-01
Лучше всего дляРассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.353.2 GB6 GBЗаметная потеря
Q4_K_MРекомендуется4.854.6 GB8 GBРекомендуется
Q5_K_M5.655.4 GB12 GBВысокое
Q8_08.58.1 GB12 GBПочти оригинал
F161615.2 GB24 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.5 GB~5.1 GB
8K токенов~1.0 GB~5.6 GB
32K токенов~4.1 GB~8.7 GB
128K токенов~16.4 GB~21.0 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~66 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~186 tok/s
Apple M-series (base)100 GB/s~18 tok/s
Apple M-series Pro270 GB/s~50 tok/s
Apple M-series Max410 GB/s~76 tok/s
CPU only (dual-channel DDR5)60 GB/s~11 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run deepseek-r1

Частые вопросы