← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить SmolLM2 1.7B?

Модели SmolLM2 1.7B от Hugging Face нужно около 3 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.0 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~297 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

SmolLM2 1.7B пригодится там, где Llama 8B — это перебор: по-настоящему крошечная чат-модель, которую можно запустить почти где угодно. В 4-битной квантовке она весит около 1 GB, а для работы с запасом памяти ей нужно всего порядка 3 GB RAM, так что она идёт на базовом Mac с M1, на бюджетном ноутбуке, на плате класса Raspberry Pi или на любом современном смартфоне с небольшим запасом. Лицензия — Apache 2.0, то есть модель можно использовать коммерчески и в продакшене без всяких ограничений со стороны провайдера. Воспринимайте её как модель, которую вы встраиваете, а не ту, с которой сидите и болтаете весь день.

В повседневной работе главный козырь — чистая скорость генерации. На RTX 3060 она выдаёт около 297 токенов в секунду, M Max разгоняет её примерно до 338, а 4090 доходит до 831 — намного быстрее, чем вы успеваете читать. Даже на обычном DDR5 CPU получается около 49 токенов в секунду, чего вполне хватает для коротких ответов вообще без GPU. Реальное ограничение — контекстное окно в 8K. По нынешним меркам это мало, поэтому модель хороша для одиночных вопросов, классификации и коротких выжимок, но длинный документ она не удержит. Память тут не проблема: даже при полностью заполненных 8K расход доходит лишь до примерно 1.5 GB.

Будьте честны в том, что даёт 1.7B параметров. Модель тянет лёгкий чат, форматирование и простое следование инструкциям, но пасует на многошаговых рассуждениях и более длинных задачах по коду. Qwen 3 1.7B обычно обходит её на сложных структурированных запросах, а DeepSeek R1 1.5B справляется лучше, когда вам реально нужна цепочка рассуждений, а не быстрый ответ. По сравнению с Llama 3.2 1B она берёт чуть большим весом, зато выдаёт более стабильный результат. Её сильная черта — эффективность: полностью открытый, пригодный для коммерческого использования ассистент, который быстро работает на железе, где ничто столь же способное попросту не запустится. Берите её, когда компактность важнее глубины.

Характеристики

Параметры1.7B
Контекстное окно8K токенов
РазработчикHugging Face
ЛицензияApache 2.0
Дата выхода2024-11
Лучше всего дляЧат

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.350.7 GB3 GBЗаметная потеря
Q4_K_MРекомендуется4.851.0 GB3 GBРекомендуется
Q5_K_M5.651.2 GB3 GBВысокое
Q8_08.51.8 GB4 GBПочти оригинал
F16163.4 GB6 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.3 GB~1.3 GB
8K токенов~0.5 GB~1.5 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run smollm2

Частые вопросы