Могу ли я запустить Llama 3.2 3B?
Модели Llama 3.2 3B от Meta нужно около 4 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.9 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~158 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
Llama 3.2 3B — это модель, к которой стоит обращаться, когда нужен полноценный ассистент на железе, которое почти не замечает нагрузки. В 4-битной квантизации она занимает около 1.9 GB и требует всего порядка 4 GB RAM, поэтому помещается практически куда угодно: на бюджетный ноутбук, на плату класса Raspberry с достаточным объёмом памяти, на старую видеокарту с 6 GB или на любой Mac с Apple Silicon, где есть запас. Если семейство 8B оказывается тяжёлым для вашей машины, это тот шаг вниз, на котором чат остаётся по-настоящему полезным.
В повседневной работе главное преимущество — скорость. На RTX 3060 можно рассчитывать примерно на 158 токенов в секунду, а 4090 разгоняет это до примерно 442 — это намного быстрее, чем вы успеваете читать; даже CPU с DDR5 выдаёт около 26 tok/s, если видеокарты нет вовсе. Контекстное окно заявлено в 128K, но к памяти стоит относиться трезво: его полное заполнение поднимает суммарное потребление примерно до 13 GB — заметно выше базового аппетита модели, так что на слабых машинах держите рабочий контекст в пределах нескольких тысяч токенов.
На фоне собственного семейства Llama 3.2 3B жертвует глубиной ради компактности. Llama 3.1 8B в целом лучше справляется со сложными рассуждениями и многошаговыми инструкциями, а младшая 1B оправдана лишь тогда, когда вы действительно ограничены в памяти и готовы мириться со слабыми ответами. Главная черта 3B в том, что это самая маленькая Llama, которая всё ещё ощущается как толковый собеседник, а не игрушка. Одна оговорка: она поставляется под лицензией Llama Community — она открытая по весам, но несёт собственные условия Meta, поэтому это не полноценный open-source. Изучите эти условия, прежде чем строить на ней продукт.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.3 GB | 4 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 1.9 GB | 4 GB | Рекомендуется |
| Q5_K_M | 5.65 | 2.3 GB | 6 GB | Высокое |
| Q8_0 | 8.5 | 3.4 GB | 6 GB | Почти оригинал |
| F16 | 16 | 6.4 GB | 12 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.3 GB | ~2.2 GB |
| 8K токенов | ~0.7 GB | ~2.6 GB |
| 32K токенов | ~2.8 GB | ~4.7 GB |
| 128K токенов | ~11.1 GB | ~13.0 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~158 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~442 tok/s |
| Apple M-series (base) | 100 GB/s | ~44 tok/s |
| Apple M-series Pro | 270 GB/s | ~118 tok/s |
| Apple M-series Max | 410 GB/s | ~180 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~26 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run llama3.2Источники и загрузки