← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить QwQ 32B?

Модели QwQ 32B от Alibaba нужно около 32 GB RAM при рекомендуемой 4-битной квантизации (загрузка 19.9 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~18 tok/s на Apple M-series Max.

Считываем характеристики вашего железа…

Заметки из практики

QwQ 32B от Alibaba — это специалист по рассуждениям, а не обычная чат-модель, и это важно понимать ещё до загрузки. Это плотная модель на 32.8B параметров, которая «думает вслух», выстраивая длинные цепочки рассуждений перед ответом: она сильна в математике и многошаговых задачах, но медленна и многословна для коротких вопросов. В 4-битной квантизации она занимает около 19.9 GB, поэтому RTX 3060 с 12 GB её попросту не вместит. Чтобы вообще запустить модель, реально нужно 32 GB системной или единой памяти — это уровень рабочей станции, GPU на 24 GB или старших Apple Silicon, а не типичной игровой видеокарты.

В повседневной работе она ощущается обстоятельной, а не быстрой. На RTX 4090 в 4-битном режиме можно рассчитывать примерно на 43 токена в секунду, и это звучит неплохо, пока не вспомнишь, что модель тратит большую часть токенов на рассуждения до самого ответа, так что один сложный запрос может выполняться долго. На Apple M Max скорость падает примерно до 18 токенов в секунду, а на CPU с DDR5 еле ползёт около 3 токенов в секунду. Контекст 128K настоящий, но при выходе на предел общий объём памяти доходит примерно до 51.6 GB — это намного выше порога в 32 GB, поэтому держите рабочий контекст умеренным, если у вас нет запаса.

В сравнении с DeepSeek R1 32B, другой плотной 32B-моделью для рассуждений из этого набора, обе близки по объёму памяти и назначению, и победитель зависит скорее от конкретной задачи, чем от какого-то однозначного преимущества, так что стоит попробовать обе. Если у вас всего пара гигабайт, крошечные чат-модели Qwen 3 0.6B или 1.7B — это совсем другой инструмент: годятся для быстрых ответов, но не для глубоких рассуждений, под которые создана QwQ. Главное достоинство QwQ — пошаговые рассуждения уровня топовых моделей при размере, который можно развернуть у себя, а лицензия Apache 2.0 позволяет использовать её в коммерческих проектах бесплатно и без лицензионных ограничений.

Характеристики

Параметры32.8B
Контекстное окно128K токенов
РазработчикAlibaba
ЛицензияApache 2.0
Дата выхода2025-03
Лучше всего дляРассуждения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.3513.7 GB24 GBЗаметная потеря
Q4_K_MРекомендуется4.8519.9 GB32 GBРекомендуется
Q5_K_M5.6523.2 GB32 GBВысокое
Q8_08.534.8 GB48 GBПочти оригинал
F161665.6 GB96 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~1.0 GB~20.9 GB
8K токенов~2.0 GB~21.9 GB
32K токенов~7.9 GB~27.8 GB
128K токенов~31.7 GB~51.6 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/sНе поместится в VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~18 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run qwq

Частые вопросы