Могу ли я запустить Phi-4 Reasoning Vision 15B?
Модели Phi-4 Reasoning Vision 15B от Microsoft нужно около 16 GB RAM при рекомендуемой 4-битной квантизации (загрузка 9.1 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~34 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
Phi-4 Reasoning Vision 15B — это модель Microsoft с открытыми весами (под лицензией MIT, то есть её можно свободно использовать в коммерческих проектах), созданная для работы с изображениями и рассуждений, а не для обычного чата. Это плотная (dense) модель на 15B параметров: при каждом токене целиком загружается и работает вся сеть. В 4-битной квантизации она занимает около 9.1 GB, поэтому для полного размещения на GPU нужна карта вроде RTX 3060 на 12 GB, плюс минимум 16 GB оперативной памяти. На более скромном железе можно опуститься до 2-битной сборки (примерно 6.3 GB), но качество на этом уровне заметно падает.
В повседневной работе на RTX 3060 с 12 GB модель ощущается бодро — около 34 tok/s в 4-битном режиме, что комфортно для чтения, а RTX 4090 на 24 GB разгоняет её примерно до 94 tok/s. На Apple M-series Max стоит ожидать около 38 tok/s. Контекстное окно — 16K, что довольно скромно, поэтому относитесь к нему как к рабочему блокноту, а не как к месту для целых документов. Даже при 8K контекста полный объём памяти вырастает примерно до 10.5 GB, так что на карте с 12 GB оставляйте запас.
На фоне родственных моделей Phi-4 14B и Qwen 3 14B — лучший выбор, если вам нужна универсальная модель для чата и рассуждений, ведь эта сборка жертвует частью такой широты ради понимания изображений. Phi-4 Mini 3.8B — более лёгкий вариант, когда памяти в обрез. Главное достоинство здесь в том, что вы получаете настоящие мультимодальные рассуждения при объёме, который всё ещё помещается на одну видеокарту среднего класса, а лицензия MIT означает отсутствие каких-либо коммерческих ограничений.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 6.3 GB | 12 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 9.1 GB | 16 GB | Рекомендуется |
| Q5_K_M | 5.65 | 10.6 GB | 16 GB | Высокое |
| Q8_0 | 8.5 | 15.9 GB | 24 GB | Почти оригинал |
| F16 | 16 | 30.0 GB | 48 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.7 GB | ~9.8 GB |
| 8K токенов | ~1.4 GB | ~10.5 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~34 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~94 tok/s |
| Apple M-series (base) | 100 GB/s | ~9 tok/s |
| Apple M-series Pro | 270 GB/s | ~25 tok/s |
| Apple M-series Max | 410 GB/s | ~38 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.