Могу ли я запустить SmolLM2 1.7B?
Модели SmolLM2 1.7B от Hugging Face нужно около 3 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.0 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~297 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
SmolLM2 1.7B пригодится там, где Llama 8B — это перебор: по-настоящему крошечная чат-модель, которую можно запустить почти где угодно. В 4-битной квантовке она весит около 1 GB, а для работы с запасом памяти ей нужно всего порядка 3 GB RAM, так что она идёт на базовом Mac с M1, на бюджетном ноутбуке, на плате класса Raspberry Pi или на любом современном смартфоне с небольшим запасом. Лицензия — Apache 2.0, то есть модель можно использовать коммерчески и в продакшене без всяких ограничений со стороны провайдера. Воспринимайте её как модель, которую вы встраиваете, а не ту, с которой сидите и болтаете весь день.
В повседневной работе главный козырь — чистая скорость генерации. На RTX 3060 она выдаёт около 297 токенов в секунду, M Max разгоняет её примерно до 338, а 4090 доходит до 831 — намного быстрее, чем вы успеваете читать. Даже на обычном DDR5 CPU получается около 49 токенов в секунду, чего вполне хватает для коротких ответов вообще без GPU. Реальное ограничение — контекстное окно в 8K. По нынешним меркам это мало, поэтому модель хороша для одиночных вопросов, классификации и коротких выжимок, но длинный документ она не удержит. Память тут не проблема: даже при полностью заполненных 8K расход доходит лишь до примерно 1.5 GB.
Будьте честны в том, что даёт 1.7B параметров. Модель тянет лёгкий чат, форматирование и простое следование инструкциям, но пасует на многошаговых рассуждениях и более длинных задачах по коду. Qwen 3 1.7B обычно обходит её на сложных структурированных запросах, а DeepSeek R1 1.5B справляется лучше, когда вам реально нужна цепочка рассуждений, а не быстрый ответ. По сравнению с Llama 3.2 1B она берёт чуть большим весом, зато выдаёт более стабильный результат. Её сильная черта — эффективность: полностью открытый, пригодный для коммерческого использования ассистент, который быстро работает на железе, где ничто столь же способное попросту не запустится. Берите её, когда компактность важнее глубины.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 1.0 GB | 3 GB | Рекомендуется |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Высокое |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Почти оригинал |
| F16 | 16 | 3.4 GB | 6 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.3 GB | ~1.3 GB |
| 8K токенов | ~0.5 GB | ~1.5 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run smollm2