← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Qwen 3.6 35B-A3B?

Модели Qwen 3.6 35B-A3B от Alibaba нужно около 32 GB RAM при рекомендуемой 4-битной квантизации (загрузка 21.2 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~192 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Qwen 3.6 35B-A3B построена по схеме mixture-of-experts, и именно это определяет, кому она нужна. В модели 35B параметров суммарно, но на каждый токен активируется лишь 3B, поэтому она работает со скоростью крошечной модели, но требует памяти как у большой. В 4-битной квантизации веса занимают около 21.2 GB, однако чтобы держать весь набор экспертов, модели всё равно нужно минимум примерно 32 GB RAM. Это исключает карту на 12 GB вроде RTX 3060 — туда она просто не помещается. Естественная среда для неё — RTX 4090 на 24 GB или Mac на Apple Silicon с большим объёмом unified memory.

В повседневной работе ставка на активные 3B окупается: на 4090 можно увидеть около 471 tok/s, а на M-series Max — около 192, что быстрее большинства плотных моделей втрое меньшего размера. Даже инференс на CPU с DDR5 выдаёт порядка 28 tok/s — пригодно для пакетных задач. Модель тянет чат, рассуждения, написание кода и работу с изображениями, так что вполне оправдывает себя как единственная локальная модель «на все случаи». Контекстное окно в 256K щедрое, но загвоздка в памяти: заполнение всего 128K уже поднимает общий объём примерно до 53.8 GB, поэтому для длинного контекста нужна машина на 64 GB, а не карта на 24 GB.

В сравнении с плотной Command R 35B из родственной линейки эта MoE при том же номинальном размере ощущается заметно быстрее: вы платите памятью за 35B, а считаете как 3B. Расплата стандартная для MoE: плотная модель на 35B иногда способна вырваться вперёд в самых сложных рассуждениях с одного захода, хотя для большинства задач выигрывает скорость. Её главная черта — именно это соотношение скорости и возможностей плюс встроенное зрение в одном пакете. Лицензия — Apache 2.0, так что вы вольны использовать её коммерчески и в продакшене без каких-либо ограничений со стороны провайдера.

Характеристики

Параметры35B (3B активных)
Контекстное окно256K токенов
РазработчикAlibaba
ЛицензияApache 2.0
Дата выхода2026-04
Лучше всего дляЧат, Рассуждения, Код, Изображения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3514.7 GB24 GBЗаметная потеря
Q4_K_MРекомендуется4.8521.2 GB32 GBРекомендуется
Q5_K_M5.6524.7 GB48 GBВысокое
Q8_08.537.2 GB48 GBПочти оригинал
F161670.0 GB96 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.0 GB~22.2 GB
8K токенов~2.0 GB~23.2 GB
32K токенов~8.1 GB~29.3 GB
128K токенов~32.6 GB~53.8 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run qwen3.6:35b

Частые вопросы