← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Llama 3.3 70B?

Модели Llama 3.3 70B от Meta нужно около 64 GB RAM при рекомендуемой 4-битной квантизации (загрузка 42.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~8 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Llama 3.3 70B — это модель, к которой обращаешься, когда 8B уже не хватает по уму, а железо позволяет потянуть что-то посерьёзнее. Это плотная (dense) чат-модель на 70,6 миллиарда параметров, и её аппетиты соответствуют размеру: даже при 4-битной квантизации она занимает около 42.8 GB, и для комфортной загрузки желательно иметь минимум 64 GB системной памяти. Если опуститься до 2-битной квантизации, размер падает примерно до 29.6 GB, но реальное место для этой модели — машина на Apple Silicon с большим объёмом памяти или сборка с несколькими GPU, а не одна потребительская видеокарта.

В повседневной работе главная честная оговорка — скорость. На чипе M-серии Max вы получите около 8 tok/s при 4-битной квантизации: читать можно, но достаточно медленно, чтобы ощущать каждый длинный ответ, а на CPU с DDR5 скорость еле ползёт — примерно 1 tok/s. Контекстное окно в 128K действительно большое, но заполнять его дорого: при полных 128K общий объём занимаемой памяти вырастает примерно до 87.5 GB — это заметно больше, чем 42.8 GB, нужные только под веса. Держите рабочий контекст умеренным, если у вас нет запаса по памяти.

Учтите, что указанные RTX 3060 и RTX 4090 просто не вмещают эту модель в 4-битном виде, так что одна массовая GPU здесь не вариант. В сравнении с DeepSeek R1 70B, у которой такое же число параметров, R1 — специалист по рассуждениям и обычно вырывается вперёд на сложной многошаговой математике, тогда как Llama 3.3 70B — более надёжная и широко совместимая универсальная чат-модель. Её главная сильная сторона — почти флагманское качество диалога при открытых весах. Одна оговорка: лицензия Llama Community — это открытые веса, а не настоящий open source, поэтому проверьте условия Meta перед любым коммерческим развёртыванием.

Характеристики

Параметры70.6B
Контекстное окно128K токенов
РазработчикMeta
ЛицензияLlama Community
Дата выхода2024-12
Лучше всего дляЧат

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3529.6 GB48 GBЗаметная потеря
Q4_K_MРекомендуется4.8542.8 GB64 GBРекомендуется
Q5_K_M5.6549.9 GB64 GBВысокое
Q8_08.575.0 GB96 GBПочти оригинал
F1616141.2 GB192 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.4 GB~44.2 GB
8K токенов~2.8 GB~45.6 GB
32K токенов~11.2 GB~54.0 GB
128K токенов~44.7 GB~87.5 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~2 tok/s
Apple M-series Pro270 GB/s~5 tok/s
Apple M-series Max410 GB/s~8 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run llama3.3

Частые вопросы

Могу ли я запустить Llama 3.3 70B? — Системные требования