← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Llama 4 Scout?

Модели Llama 4 Scout от Meta нужно около 96 GB RAM при рекомендуемой 4-битной квантизации (загрузка 66.1 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~34 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Llama 4 Scout — это модель Meta с архитектурой mixture-of-experts, и главное здесь — понять разрыв между двумя её размерами. Всего в ней 109B параметров, но на каждый токен задействуется лишь 17B из них, поэтому генерирует она со скоростью модели на 17B, а память требует как полная модель на 109B. В 4-битном кванте это около 66 GB на диске, и для загрузки нужно минимум 96 GB RAM или unified memory. Это не модель для 24-гигабайтной потребительской видеокарты: ни RTX 3060, ни RTX 4090 её попросту не вмещают. Реально это задача для рабочей станции или Apple Silicon в максимальной комплектации.

На Apple M Max с достаточным объёмом unified memory она выдаёт около 34 tok/s в 4-битном кванте — это заметно быстрее, чем вы читаете, и вполне комфортно для интерактивного чата и её vision-задач. На CPU с DDR5 скорость падает примерно до 5 tok/s: годится для пакетной обработки, но мучительно для диалога в реальном времени. Заявленный контекст огромен, но будьте осторожны: приближение к 128K токенов поднимает общий объём памяти примерно до 120 GB, так что длинный контекст — это решение в рамках бюджета на железо, а не бесплатная настройка. Держите рабочий контекст скромным, если у вас нет запаса по памяти.

По сравнению с GPT-OSS 120B, другой крупной моделью этого класса, Scout выигрывает как мультимодальный выбор, поскольку умеет работать с изображениями, тогда как GPT-OSS обычно сильнее в чистом рассуждении. На фоне младших родственников вроде Llama 3.2 3B Scout — это совершенно иной уровень обязательств: те запускаются на «телефонном» объёме памяти, а этой нужен сервер. Её главное достоинство — действительно быстрая модель с поддержкой изображений на таком масштабе. Одна оговорка: она поставляется под лицензией Llama Community, которая является open-weight, а не open-source, поэтому проверьте условия, прежде чем строить на ней что-либо коммерческое.

Характеристики

Параметры109B (17B активных)
Контекстное окно10M токенов
РазработчикMeta
ЛицензияLlama Community
Дата выхода2025-04
Лучше всего дляЧат, Изображения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3545.6 GB64 GBЗаметная потеря
Q4_K_MРекомендуется4.8566.1 GB96 GBРекомендуется
Q5_K_M5.6577.0 GB128 GBВысокое
Q8_08.5115.8 GB192 GBПочти оригинал
F1616218.0 GB256 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.7 GB~67.8 GB
8K токенов~3.4 GB~69.5 GB
32K токенов~13.6 GB~79.7 GB
128K токенов~54.3 GB~120.4 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~8 tok/s
Apple M-series Pro270 GB/s~22 tok/s
Apple M-series Max410 GB/s~34 tok/s
CPU only (dual-channel DDR5)60 GB/s~5 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run llama4:scout

Частые вопросы