Могу ли я запустить Qwen 3.5 122B-A10B?
Модели Qwen 3.5 122B-A10B от Alibaba нужно около 96 GB RAM при рекомендуемой 4-битной квантизации (загрузка 74.0 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~57 tok/s на Apple M-series Max.
Считываем характеристики вашего железа…
Заметки из практики
Qwen 3.5 122B-A10B — это крупная mixture-of-experts модель для тех, кто хочет получить чат, рассуждения, программирование и работу с изображениями уровня флагманов прямо на своём железе. Вся суть в архитектуре MoE: из 122B общих параметров на каждый токен активируются лишь 10B, поэтому она генерирует заметно быстрее, чем плотная модель такого же размера. Подвох — в памяти: всю модель всё равно приходится держать в оперативке целиком. В 4-битной квантизации это около 74 GB, а чтобы вообще её загрузить, нужно примерно 96 GB RAM. На практике это означает рабочую станцию с большим объёмом памяти или Mac на Apple Silicon с обширной унифицированной памятью; на 24 GB RTX 4090 она не помещается, не говоря уже о 12 GB карте.
Там, где модель всё же помещается, для своего размера она ощущается на удивление шустрой — спасибо тем самым 10B активных параметров. На M Max можно рассчитывать примерно на 57 токенов в секунду: достаточно быстро, чтобы комфортно читать ответ по мере его вывода, тогда как на машине только с CPU и DDR5 скорость падает примерно до 8 токенов в секунду и больше подходит для пакетной обработки, чем для живого чата. Контекстное окно достигает 256K, но воспринимайте это как потолок. Память растёт вместе с тем, что вы реально заполняете, и при 128K контекста общий объём поднимается примерно до 131 GB, так что цифры по длинному контексту предполагают машину, специально под них собранную.
В сравнении с Devstral 2 123B, у которой почти такое же число параметров, Qwen 3.5, как правило, жертвует узкой заточенностью под код ради широты охвата: она покрывает чат, рассуждения и работу с изображениями в одной модели, а не специализируется на чём-то одном. Эта универсальность и есть её главное достоинство, а младшие версии Qwen 3 0.6B и 1.7B остаются разумным выбором, когда вам нужен лишь лёгкий чат на скромном железе. Лицензия — Apache 2.0, так что использовать её можно коммерчески и в продакшене без ограничений, что для такого уровня возможностей встречается редко и само по себе веский повод предпочесть её более обременённым весам.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 51.1 GB | 96 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 74.0 GB | 96 GB | Рекомендуется |
| Q5_K_M | 5.65 | 86.2 GB | 128 GB | Высокое |
| Q8_0 | 8.5 | 129.6 GB | 192 GB | Почти оригинал |
| F16 | 16 | 244.0 GB | 256 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~1.8 GB | ~75.8 GB |
| 8K токенов | ~3.6 GB | ~77.6 GB |
| 32K токенов | ~14.3 GB | ~88.3 GB |
| 128K токенов | ~57.2 GB | ~131.2 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Не поместится в VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Не поместится в VRAM |
| Apple M-series (base) | 100 GB/s | ~14 tok/s |
| Apple M-series Pro | 270 GB/s | ~38 tok/s |
| Apple M-series Max | 410 GB/s | ~57 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~8 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run qwen3.5:122bИсточники и загрузки
Ollama Library
Скачайте и запустите модель одной командой.
ollama.comHugging Face
Веса модели, файлы и подробности лицензии.
huggingface.coОфициальный репозиторий на GitHub
Исходный код, релизы и issues от Alibaba.
github.comAlibaba — официальная страница
Официальная страница и документация от Alibaba.
qwen.ai