← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Llama 3.2 3B?

Модели Llama 3.2 3B от Meta нужно около 4 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.9 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~158 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

Llama 3.2 3B — это модель, к которой стоит обращаться, когда нужен полноценный ассистент на железе, которое почти не замечает нагрузки. В 4-битной квантизации она занимает около 1.9 GB и требует всего порядка 4 GB RAM, поэтому помещается практически куда угодно: на бюджетный ноутбук, на плату класса Raspberry с достаточным объёмом памяти, на старую видеокарту с 6 GB или на любой Mac с Apple Silicon, где есть запас. Если семейство 8B оказывается тяжёлым для вашей машины, это тот шаг вниз, на котором чат остаётся по-настоящему полезным.

В повседневной работе главное преимущество — скорость. На RTX 3060 можно рассчитывать примерно на 158 токенов в секунду, а 4090 разгоняет это до примерно 442 — это намного быстрее, чем вы успеваете читать; даже CPU с DDR5 выдаёт около 26 tok/s, если видеокарты нет вовсе. Контекстное окно заявлено в 128K, но к памяти стоит относиться трезво: его полное заполнение поднимает суммарное потребление примерно до 13 GB — заметно выше базового аппетита модели, так что на слабых машинах держите рабочий контекст в пределах нескольких тысяч токенов.

На фоне собственного семейства Llama 3.2 3B жертвует глубиной ради компактности. Llama 3.1 8B в целом лучше справляется со сложными рассуждениями и многошаговыми инструкциями, а младшая 1B оправдана лишь тогда, когда вы действительно ограничены в памяти и готовы мириться со слабыми ответами. Главная черта 3B в том, что это самая маленькая Llama, которая всё ещё ощущается как толковый собеседник, а не игрушка. Одна оговорка: она поставляется под лицензией Llama Community — она открытая по весам, но несёт собственные условия Meta, поэтому это не полноценный open-source. Изучите эти условия, прежде чем строить на ней продукт.

Характеристики

Параметры3.2B
Контекстное окно128K токенов
РазработчикMeta
ЛицензияLlama Community
Дата выхода2024-09
Лучше всего дляЧат

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.351.3 GB4 GBЗаметная потеря
Q4_K_MРекомендуется4.851.9 GB4 GBРекомендуется
Q5_K_M5.652.3 GB6 GBВысокое
Q8_08.53.4 GB6 GBПочти оригинал
F16166.4 GB12 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.3 GB~2.2 GB
8K токенов~0.7 GB~2.6 GB
32K токенов~2.8 GB~4.7 GB
128K токенов~11.1 GB~13.0 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~158 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~442 tok/s
Apple M-series (base)100 GB/s~44 tok/s
Apple M-series Pro270 GB/s~118 tok/s
Apple M-series Max410 GB/s~180 tok/s
CPU only (dual-channel DDR5)60 GB/s~26 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run llama3.2

Частые вопросы

Могу ли я запустить Llama 3.2 3B? — Системные требования