← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Granite 4.0 H Small?

Модели Granite 4.0 H Small от IBM нужно около 32 GB RAM при рекомендуемой 4-битной квантизации (загрузка 19.4 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~64 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Granite 4.0 H Small — это MoE-модель (mixture-of-experts) от IBM: 32B параметров на бумаге, но на каждый токен активны лишь около 9B. Именно это разделение определяет всё. Модель работает быстро для своего размера, потому что каждый токен задействует лишь часть весов, но в память всё равно нужно загрузить модель целиком, поэтому ориентируйтесь на минимум 32 GB, а не на число активных параметров. В 4-битной квантизации она занимает около 19.4 GB, что полностью исключает 12 GB карту вроде RTX 3060 и указывает на GPU с 24 GB или Mac на Apple Silicon с большим объёмом унифицированной памяти. Она рассчитана на чат и работу с кодом, а не на лёгкие эксперименты на ноутбуке.

На RTX 4090 она выдаёт примерно 157 токенов в секунду — это заметно быстрее скорости чтения и делает её приятной для интерактивных сессий программирования. На M-серии Max речь идёт о порядка 64 tok/s, по-прежнему комфортно, а на чистом CPU с DDR5 скорость падает примерно до 9 tok/s — годится для пакетных задач, но не для живого чата. Контекст 128K реален, но обходится дорого: заполните его, и суммарный объём памяти вырастает примерно до 50.7 GB, так что на карте с 24 GB подобраться к потолку на практике не получится. Держите рабочий контекст умеренным, если только у вас нет свободного Mac на 64 GB.

По сравнению с Qwen 3 32B, плотной (dense) моделью схожего общего размера, Granite обычно ощущается легче для железа благодаря архитектуре MoE, хотя Qwen 3 чаще выигрывает в тяжёлых рассуждениях, поскольку активирует все свои параметры на каждом токене. Если нужно что-то меньше и проще, плотная Granite 3.3 8B легче встаёт на скромные GPU. Главная сильная сторона Granite 4.0 H Small — это по-настоящему быстрая модель класса 32B, которую реально развернуть у себя, и она поставляется под лицензией Apache 2.0, так что её можно свободно использовать в коммерции без забот о лицензировании.

Характеристики

Параметры32B (9B активных)
Контекстное окно128K токенов
РазработчикIBM
ЛицензияApache 2.0
Дата выхода2025-10
Лучше всего дляЧат, Код

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3513.4 GB24 GBЗаметная потеря
Q4_K_MРекомендуется4.8519.4 GB32 GBРекомендуется
Q5_K_M5.6522.6 GB32 GBВысокое
Q8_08.534.0 GB48 GBПочти оригинал
F161664.0 GB96 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.0 GB~20.4 GB
8K токенов~2.0 GB~21.4 GB
32K токенов~7.8 GB~27.2 GB
128K токенов~31.3 GB~50.7 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/s~157 tok/s
Apple M-series (base)100 GB/s~16 tok/s
Apple M-series Pro270 GB/s~42 tok/s
Apple M-series Max410 GB/s~64 tok/s
CPU only (dual-channel DDR5)60 GB/s~9 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run granite4:32b-a9b-h

Частые вопросы