← Все моделиПРОВЕРКА МОДЕЛИ

Могу ли я запустить Ministral 3 3B?

Модели Ministral 3 3B от Mistral AI нужно около 4 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~168 tok/s на NVIDIA RTX 3060 12GB.

Считываем характеристики вашего железа…

Заметки из практики

Ministral 3 3B — это ответ Mistral на вопрос «какой минимальный размер модели всё ещё ощущается как настоящий ассистент?». При 3B параметров она создана для чата и лёгких задач со зрением на железе, которое у вас уже есть. 4-битная квантизация занимает около 1.8 GB, а сборку q2 можно ужать до 1.3 GB, если совсем впритык. С минимумом в 4 GB RAM она работает на бюджетном ноутбуке, старой видеокарте на 4 GB или любом Mac на Apple Silicon — о памяти можно вообще не думать. Это та модель, к которой тянешься, когда модель побольше попросту не помещается.

В повседневной работе главное — скорость. На RTX 3060 вы увидите примерно 168 токенов в секунду, M-серия Max выдаёт около 192, а 4090 разгоняется до ~471 — всё это намного быстрее, чем вы успеваете читать, так что ответы кажутся мгновенными. Даже на одном CPU с DDR5 выходит около 28 tok/s, чего хватает для пакетной обработки. Контекстное окно щедрое — 256K, но относитесь к нему как к потолку. Заполнять его дорого: при 128K контекста суммарная нагрузка на память поднимается примерно до 12.6 GB, заметно выше собственного объёма модели, поэтому на слабых машинах держите рабочий контекст скромным.

Честно говоря, на 3B вы меняете часть глубины на эту скорость и крошечный объём. Mistral 7B обычно держится лучше на более сложных рассуждениях и длинных цепочках инструкций, а Mistral Nemo 12B уходит ещё дальше вперёд, если есть запас памяти. Сильная сторона Ministral 3 3B — сочетание чистой пропускной способности и того, что она ещё и работает со зрением, чего более крупные чат-ориентированные Mistral не умеют. Она поставляется под Apache 2.0, так что её можно использовать коммерчески без каких-либо ограничений. Для быстрой, бесплатной и универсальной небольшой модели — место своё она оправдывает.

Характеристики

Параметры3B
Контекстное окно256K токенов
РазработчикMistral AI
ЛицензияApache 2.0
Дата выхода2025-12
Лучше всего дляЧат, Изображения

Размер по квантизации

КвантизацияБит/весЗагрузкаМин. RAMКачество
Q2_K3.351.3 GB4 GBЗаметная потеря
Q4_K_MРекомендуется4.851.8 GB4 GBРекомендуется
Q5_K_M5.652.1 GB6 GBВысокое
Q8_08.53.2 GB6 GBПочти оригинал
F16166.0 GB12 GBОригинал

Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →

Память в зависимости от длины контекста

КонтекстKV-кэш (оценка)Всего памяти (Q4)
4K токенов~0.3 GB~2.1 GB
8K токенов~0.7 GB~2.5 GB
32K токенов~2.7 GB~4.5 GB
128K токенов~10.8 GB~12.6 GB

KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.

Оценка скорости по железу

ЖелезоПропускная способность~Скорость
NVIDIA RTX 3060 12GB360 GB/s~168 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~471 tok/s
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.

Запустите локально

Проще всего через Ollama — одна команда, и можно общаться:

ollama run ministral-3:3b

Частые вопросы

Могу ли я запустить Ministral 3 3B? — Системные требования