← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Qwen 3.5 122B-A10B?

Модели Qwen 3.5 122B-A10B от Alibaba нужно около 96 GB RAM при рекомендуемой 4-битной квантизации (загрузка 74.0 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~57 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

Qwen 3.5 122B-A10B — это крупная mixture-of-experts модель для тех, кто хочет получить чат, рассуждения, программирование и работу с изображениями уровня флагманов прямо на своём железе. Вся суть в архитектуре MoE: из 122B общих параметров на каждый токен активируются лишь 10B, поэтому она генерирует заметно быстрее, чем плотная модель такого же размера. Подвох — в памяти: всю модель всё равно приходится держать в оперативке целиком. В 4-битной квантизации это около 74 GB, а чтобы вообще её загрузить, нужно примерно 96 GB RAM. На практике это означает рабочую станцию с большим объёмом памяти или Mac на Apple Silicon с обширной унифицированной памятью; на 24 GB RTX 4090 она не помещается, не говоря уже о 12 GB карте.

Там, где модель всё же помещается, для своего размера она ощущается на удивление шустрой — спасибо тем самым 10B активных параметров. На M Max можно рассчитывать примерно на 57 токенов в секунду: достаточно быстро, чтобы комфортно читать ответ по мере его вывода, тогда как на машине только с CPU и DDR5 скорость падает примерно до 8 токенов в секунду и больше подходит для пакетной обработки, чем для живого чата. Контекстное окно достигает 256K, но воспринимайте это как потолок. Память растёт вместе с тем, что вы реально заполняете, и при 128K контекста общий объём поднимается примерно до 131 GB, так что цифры по длинному контексту предполагают машину, специально под них собранную.

В сравнении с Devstral 2 123B, у которой почти такое же число параметров, Qwen 3.5, как правило, жертвует узкой заточенностью под код ради широты охвата: она покрывает чат, рассуждения и работу с изображениями в одной модели, а не специализируется на чём-то одном. Эта универсальность и есть её главное достоинство, а младшие версии Qwen 3 0.6B и 1.7B остаются разумным выбором, когда вам нужен лишь лёгкий чат на скромном железе. Лицензия — Apache 2.0, так что использовать её можно коммерчески и в продакшене без ограничений, что для такого уровня возможностей встречается редко и само по себе веский повод предпочесть её более обременённым весам.

Характеристики

Параметры122B (10B активных)
Контекстное окно256K токенов
РазработчикAlibaba
ЛицензияApache 2.0
Дата выхода2026-02
Лучше всего дляЧат, Рассуждения, Код, Изображения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3551.1 GB96 GBЗаметная потеря
Q4_K_MРекомендуется4.8574.0 GB96 GBРекомендуется
Q5_K_M5.6586.2 GB128 GBВысокое
Q8_08.5129.6 GB192 GBПочти оригинал
F1616244.0 GB256 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.8 GB~75.8 GB
8K токенов~3.6 GB~77.6 GB
32K токенов~14.3 GB~88.3 GB
128K токенов~57.2 GB~131.2 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/sНе поместится в VRAM
Apple M-series (base)100 GB/s~14 tok/s
Apple M-series Pro270 GB/s~38 tok/s
Apple M-series Max410 GB/s~57 tok/s
CPU only (dual-channel DDR5)60 GB/s~8 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run qwen3.5:122b

Частые вопросы

Могу ли я запустить Qwen 3.5 122B-A10B? — Системные требования