Могу ли я запустить QwQ 32B?
Модели QwQ 32B от Alibaba нужно около 32 GB RAM при рекомендуемой 4-битной квантизации (загрузка 19.9 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~18 tok/s на Apple M-series Max.
Считываем характеристики вашего железа…
Заметки из практики
QwQ 32B от Alibaba — это специалист по рассуждениям, а не обычная чат-модель, и это важно понимать ещё до загрузки. Это плотная модель на 32.8B параметров, которая «думает вслух», выстраивая длинные цепочки рассуждений перед ответом: она сильна в математике и многошаговых задачах, но медленна и многословна для коротких вопросов. В 4-битной квантизации она занимает около 19.9 GB, поэтому RTX 3060 с 12 GB её попросту не вместит. Чтобы вообще запустить модель, реально нужно 32 GB системной или единой памяти — это уровень рабочей станции, GPU на 24 GB или старших Apple Silicon, а не типичной игровой видеокарты.
В повседневной работе она ощущается обстоятельной, а не быстрой. На RTX 4090 в 4-битном режиме можно рассчитывать примерно на 43 токена в секунду, и это звучит неплохо, пока не вспомнишь, что модель тратит большую часть токенов на рассуждения до самого ответа, так что один сложный запрос может выполняться долго. На Apple M Max скорость падает примерно до 18 токенов в секунду, а на CPU с DDR5 еле ползёт около 3 токенов в секунду. Контекст 128K настоящий, но при выходе на предел общий объём памяти доходит примерно до 51.6 GB — это намного выше порога в 32 GB, поэтому держите рабочий контекст умеренным, если у вас нет запаса.
В сравнении с DeepSeek R1 32B, другой плотной 32B-моделью для рассуждений из этого набора, обе близки по объёму памяти и назначению, и победитель зависит скорее от конкретной задачи, чем от какого-то однозначного преимущества, так что стоит попробовать обе. Если у вас всего пара гигабайт, крошечные чат-модели Qwen 3 0.6B или 1.7B — это совсем другой инструмент: годятся для быстрых ответов, но не для глубоких рассуждений, под которые создана QwQ. Главное достоинство QwQ — пошаговые рассуждения уровня топовых моделей при размере, который можно развернуть у себя, а лицензия Apache 2.0 позволяет использовать её в коммерческих проектах бесплатно и без лицензионных ограничений.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.7 GB | 24 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 19.9 GB | 32 GB | Рекомендуется |
| Q5_K_M | 5.65 | 23.2 GB | 32 GB | Высокое |
| Q8_0 | 8.5 | 34.8 GB | 48 GB | Почти оригинал |
| F16 | 16 | 65.6 GB | 96 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~1.0 GB | ~20.9 GB |
| 8K токенов | ~2.0 GB | ~21.9 GB |
| 32K токенов | ~7.9 GB | ~27.8 GB |
| 128K токенов | ~31.7 GB | ~51.6 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Не поместится в VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~12 tok/s |
| Apple M-series Max | 410 GB/s | ~18 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run qwq