← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Llama 3.1 70B?

Модели Llama 3.1 70B от Meta нужно около 64 GB RAM при рекомендуемой 4-битной квантизации (загрузка 42.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~8 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Llama 3.1 70B — это модель, к которой обращаешься, когда ассистенты класса 8B перестают справляться, а под рукой есть серьёзное железо. В 4-битной квантизации она весит около 42.8 GB, и самое важное здесь — то, куда она не помещается: ни 12 GB RTX 3060, ни даже 24 GB RTX 4090 не подойдут, потому что одни только веса их переполняют. Реально это машина минимум на 64 GB, и Mac Studio с большим объёмом унифицированной памяти — самый беспроблемный вариант разместить её в одной коробке дома. Можно опуститься до 2-битной квантизации около 29.6 GB, если ужимаешься, но за это платишь качеством.

В повседневной работе она ощущается скорее обстоятельной, чем шустрой. На Apple M-Max это примерно 8 tok/s в 4-битной квантизации — читать успеваешь, но медленнее, чем говоришь, а на CPU с DDR5 она еле ползёт, около 1 tok/s: годится для пакетных задач и почти ни для чего больше. Окно контекста 128K настоящее, но здесь оно дорого обходится: его заполнение поднимает общий объём памяти примерно до 87.5 GB — заметно выше порога в 64 GB. Держи рабочий контекст скромным, если нет запаса, иначе машина начнёт уходить в своп и без того невысокая скорость окончательно просядет.

На фоне собственного семейства это тяжеловес: Llama 3.2 3B и 1B — те, что реально запускаешь на ноутбуке, тогда как 70B запускают, когда качество ответа важнее скорости. Если твоя настоящая цель — пошаговые рассуждения, DeepSeek R1 70B того же размера обычно вырывается вперёд именно по этой оси, тогда как эта Llama заточена под чат. Её главное достоинство — широкая, зрелая экосистема инструментов и стабильный результат общего назначения. Одна оговорка: лицензия Llama Community — это open-weight, а не open-source, так что сверься с условиями Meta, прежде чем встраивать модель в коммерческий продукт.

Характеристики

Параметры70.6B
Контекстное окно128K токенов
РазработчикMeta
ЛицензияLlama Community
Дата выхода2024-07
Лучше всего дляЧат

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3529.6 GB48 GBЗаметная потеря
Q4_K_MРекомендуется4.8542.8 GB64 GBРекомендуется
Q5_K_M5.6549.9 GB64 GBВысокое
Q8_08.575.0 GB96 GBПочти оригинал
F1616141.2 GB192 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.4 GB~44.2 GB
8K токенов~2.8 GB~45.6 GB
32K токенов~11.2 GB~54.0 GB
128K токенов~44.7 GB~87.5 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~2 tok/s
Apple M-series Pro270 GB/s~5 tok/s
Apple M-series Max410 GB/s~8 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run llama3.1:70b

Частые вопросы