Могу ли я запустить Qwen 3.6 35B-A3B?
Модели Qwen 3.6 35B-A3B от Alibaba нужно около 32 GB RAM при рекомендуемой 4-битной квантизации (загрузка 21.2 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~192 tok/s на Apple M-series Max.
Считываем характеристики вашего железа…
Заметки из практики
Qwen 3.6 35B-A3B построена по схеме mixture-of-experts, и именно это определяет, кому она нужна. В модели 35B параметров суммарно, но на каждый токен активируется лишь 3B, поэтому она работает со скоростью крошечной модели, но требует памяти как у большой. В 4-битной квантизации веса занимают около 21.2 GB, однако чтобы держать весь набор экспертов, модели всё равно нужно минимум примерно 32 GB RAM. Это исключает карту на 12 GB вроде RTX 3060 — туда она просто не помещается. Естественная среда для неё — RTX 4090 на 24 GB или Mac на Apple Silicon с большим объёмом unified memory.
В повседневной работе ставка на активные 3B окупается: на 4090 можно увидеть около 471 tok/s, а на M-series Max — около 192, что быстрее большинства плотных моделей втрое меньшего размера. Даже инференс на CPU с DDR5 выдаёт порядка 28 tok/s — пригодно для пакетных задач. Модель тянет чат, рассуждения, написание кода и работу с изображениями, так что вполне оправдывает себя как единственная локальная модель «на все случаи». Контекстное окно в 256K щедрое, но загвоздка в памяти: заполнение всего 128K уже поднимает общий объём примерно до 53.8 GB, поэтому для длинного контекста нужна машина на 64 GB, а не карта на 24 GB.
В сравнении с плотной Command R 35B из родственной линейки эта MoE при том же номинальном размере ощущается заметно быстрее: вы платите памятью за 35B, а считаете как 3B. Расплата стандартная для MoE: плотная модель на 35B иногда способна вырваться вперёд в самых сложных рассуждениях с одного захода, хотя для большинства задач выигрывает скорость. Её главная черта — именно это соотношение скорости и возможностей плюс встроенное зрение в одном пакете. Лицензия — Apache 2.0, так что вы вольны использовать её коммерчески и в продакшене без каких-либо ограничений со стороны провайдера.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 21.2 GB | 32 GB | Рекомендуется |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Высокое |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Почти оригинал |
| F16 | 16 | 70.0 GB | 96 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~1.0 GB | ~22.2 GB |
| 8K токенов | ~2.0 GB | ~23.2 GB |
| 32K токенов | ~8.1 GB | ~29.3 GB |
| 128K токенов | ~32.6 GB | ~53.8 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Не поместится в VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run qwen3.6:35bИсточники и загрузки
Ollama Library
Скачайте и запустите модель одной командой.
ollama.comHugging Face
Веса модели, файлы и подробности лицензии.
huggingface.coОфициальный репозиторий на GitHub
Исходный код, релизы и issues от Alibaba.
github.comAlibaba — официальная страница
Официальная страница и документация от Alibaba.
qwen.ai