← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Gemma 3n E4B?

Модели Gemma 3n E4B от Google нужно около 8 GB RAM при рекомендуемой 4-битной квантизации (загрузка 4.7 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~126 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

Gemma 3n E4B — это компактная мультимодальная модель от Google, созданная для чата и работы с изображениями; она рассчитана на тех, кому нужен толковый локальный ассистент, умеющий ещё и смотреть на картинки. Формально в ней 7.8B параметров, но это архитектура mixture-of-experts: на каждый токен активируется лишь около 4B, поэтому работает она заметно быстрее, чем подразумевает её полный размер. В 4-bit она занимает примерно 4.7 GB — это спокойно помещается в 8 GB видеопамяти карты вроде RTX 3060 с запасом, а на любом современном Mac с Apple Silicon легко ложится в общую память. Подвох MoE в том, что всю модель всё равно нужно держать в памяти, так что рассчитывайте минимум на 8 GB RAM, сколько бы экспертов ни срабатывало.

В повседневной работе ощущается шустро. На RTX 3060 12GB можно ожидать около 126 токенов в секунду в 4-bit, а 4090 разгоняет это примерно до 353 — обе цифры заметно выше скорости чтения; M-series Max держится около 144, и даже чистый CPU на DDR5 выдаёт около 21, чем вполне можно пользоваться, если вы не спешите. Работа с изображениями — это и есть главная причина брать её вместо текстовой модели такого же размера. Контекст ограничен 32K: этого хватает для чата и вопросов по документам, но как тягач для длинного контекста модель не годится. Если заполнить это окно, суммарный расход памяти поднимается примерно до 8.8 GB, поэтому на карте с 8 GB держите рабочий контекст умеренным.

В сравнении с Llama 3.1 8B — очевидной текстовой альтернативой в этом классе — Gemma 3n E4B обычно жертвует частью глубины рассуждений ради двух вещей, которые Llama при таком же размере предложить не может: нативного понимания изображений и преимущества MoE в скорости. Если нужен только текст, Gemma 3 4B — более лёгкий вариант, а Llama 3.1 8B — более надёжный выбор для чистого чата. Сильная сторона Gemma 3n E4B в том, что это действительно пригодная для работы модель vision-and-chat, которая всё ещё умещается в 8 GB. Замечание по лицензии: лицензия Gemma — open-weight, а не open-source, со своими условиями использования от Google, так что прочитайте их перед запуском в продакшн, хотя коммерческое использование разрешено.

Характеристики

Параметры7.8B (4B активных)
Контекстное окно32K токенов
РазработчикGoogle
ЛицензияGemma
Дата выхода2025-06
Лучше всего дляЧат, Изображения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.353.3 GB6 GBЗаметная потеря
Q4_K_MРекомендуется4.854.7 GB8 GBРекомендуется
Q5_K_M5.655.5 GB12 GBВысокое
Q8_08.58.3 GB12 GBПочти оригинал
F161615.6 GB24 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.5 GB~5.2 GB
8K токенов~1.0 GB~5.7 GB
32K токенов~4.1 GB~8.8 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~126 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~353 tok/s
Apple M-series (base)100 GB/s~35 tok/s
Apple M-series Pro270 GB/s~95 tok/s
Apple M-series Max410 GB/s~144 tok/s
CPU only (dual-channel DDR5)60 GB/s~21 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run gemma3n

Частые вопросы

Могу ли я запустить Gemma 3n E4B? — Системные требования