Могу ли я запустить DeepSeek R1 8B?
Модели DeepSeek R1 8B от DeepSeek нужно около 8 GB RAM при рекомендуемой 4-битной квантизации (загрузка 4.9 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~63 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
DeepSeek R1 8B — это в первую очередь модель для рассуждений, а не универсальный чат-движок на каждый день, и это стоит понимать ещё до загрузки. Это плотная модель на 8B, поэтому в 4-битной квантизации она занимает около 4.9 GB и спокойно помещается в 8 GB видеопамяти с запасом; заявленный минимум в 8 GB RAM делает её пригодной для скромного десктопа или любого Mac на Apple Silicon с унифицированной памятью. Лицензия MIT — самая простая часть: её можно использовать коммерчески, в продакшене, без каких-либо ограничений со стороны разработчика. Берите её, когда нужна модель, которая продумывает задачу, а не просто быстро выдаёт ответ.
В повседневной работе на реальном железе она ощущается шустрой для своего размера. RTX 3060 12GB выдаёт около 63 tok/s, M-серия Max — порядка 72 tok/s, а 4090 — примерно 177 tok/s, так что стриминг ответа нигде не упирается в потолок. На CPU с DDR5 скорость падает до примерно 11 tok/s — нормально для редкого запроса, но не для рабочего цикла. Главная оговорка — привычка к цепочке рассуждений: R1 рассуждает вслух, поэтому расходует контекст быстрее обычной чат-модели. Окно в 128K реальное, но при его заполнении общий объём памяти вырастает примерно до 21.7 GB, так что держите рабочий контекст умеренным, если нет запаса.
Если говорить честно, это дистиллированная модель для рассуждений, а не фронтир-уровень в маленькой коробке. По сравнению с Llama 3.1 8B она, как правило, уступает в широте разговорной гладкости и зрелости инструментария, но выигрывает в пошаговых рассуждениях; а если нужно ещё легче — ценой глубины — существуют DeepSeek R1 7B и 1.5B. Её главная сильная сторона — видимый ход рассуждений, который действительно полезен для математики, логики и отладки, где хочется видеть саму работу. Если вам в основном нужен быстрый непринуждённый чат, чат-ориентированная модель на 8B будет лучшим выбором по умолчанию; но если нужна локальная модель, которая именно рассуждает, R1 8B своё место оправдывает.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.4 GB | 6 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 4.9 GB | 8 GB | Рекомендуется |
| Q5_K_M | 5.65 | 5.7 GB | 12 GB | Высокое |
| Q8_0 | 8.5 | 8.5 GB | 16 GB | Почти оригинал |
| F16 | 16 | 16.0 GB | 24 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.5 GB | ~5.4 GB |
| 8K токенов | ~1.0 GB | ~5.9 GB |
| 32K токенов | ~4.2 GB | ~9.1 GB |
| 128K токенов | ~16.8 GB | ~21.7 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~63 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~177 tok/s |
| Apple M-series (base) | 100 GB/s | ~18 tok/s |
| Apple M-series Pro | 270 GB/s | ~47 tok/s |
| Apple M-series Max | 410 GB/s | ~72 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~11 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run deepseek-r1:8bИсточники и загрузки
Ollama Library
Скачайте и запустите модель одной командой.
ollama.comHugging Face
Веса модели, файлы и подробности лицензии.
huggingface.coОфициальный репозиторий на GitHub
Исходный код, релизы и issues от DeepSeek.
github.comDeepSeek — официальная страница
Официальная страница и документация от DeepSeek.
deepseek.com