← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить DeepSeek R1 70B?

Модели DeepSeek R1 70B от DeepSeek нужно около 64 GB RAM при рекомендуемой 4-битной квантизации (загрузка 42.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~8 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

DeepSeek R1 70B — это модель, к которой вы обращаетесь, когда нужно рассуждение с цепочкой мыслей полностью на собственном железе, а не быстрый помощник для чата. В 4-битной квантизации она весит около 42.8 GB и требует минимум порядка 64 GB оперативной памяти, что сразу исключает одну потребительскую видеокарту: она не поместится ни на RTX 3060 12GB, ни даже на RTX 4090 24GB. Реалистичный дом для неё — Mac с большим объёмом унифицированной памяти или рабочая станция с 64 GB и более, где весь набор весов реально остаётся в памяти. Это серьёзное обязательство, а не загрузка на пробу.

В повседневной работе честный вывод такой: она медленная. На Apple M-Max вы получите примерно 8 токенов в секунду, а на CPU с DDR5 скорость падает примерно до 1 токена в секунду, так что ответы в лучшем случае приходят со скоростью чтения, а в худшем — еле ползут. Поскольку R1 думает вслух перед ответом, значительная часть этих токенов уходит на видимые рассуждения, и один ответ может занять немало времени. Контекст в 128K есть, но его заполнение поднимает общий объём памяти примерно до 87.5 GB — заметно выше планки в 64 GB, поэтому держите рабочий контекст скромным, если только у вас нет запаса.

В сравнении с собственным семейством расклад прямой: DeepSeek R1 7B или крошечная 1.5B работают намного быстрее и помещаются на скромное железо, но эта 70B в целом держится лучше на сложных многошаговых рассуждениях, где меньшие дистилляты склонны терять нить. По сравнению с Llama 3.1 70B, заточенной под чат, отличительная черта R1 70B — именно этот явный стиль рассуждения, который лучше подходит для задач по математике и логике, чем для свободного разговора. Лицензия MIT здесь — самая простая часть: вы можете использовать модель коммерчески и в продакшене без специфичных для провайдера ограничений. Просто заложите в бюджет память и ожидание.

Характеристики

Параметры70.6B
Контекстное окно128K токенов
РазработчикDeepSeek
ЛицензияMIT
Дата выхода2025-01
Лучше всего дляРассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3529.6 GB48 GBЗаметная потеря
Q4_K_MРекомендуется4.8542.8 GB64 GBРекомендуется
Q5_K_M5.6549.9 GB64 GBВысокое
Q8_08.575.0 GB96 GBПочти оригинал
F1616141.2 GB192 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.4 GB~44.2 GB
8K токенов~2.8 GB~45.6 GB
32K токенов~11.2 GB~54.0 GB
128K токенов~44.7 GB~87.5 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~2 tok/s
Apple M-series Pro270 GB/s~5 tok/s
Apple M-series Max410 GB/s~8 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run deepseek-r1:70b

Частые вопросы