Могу ли я запустить Ministral 3 3B?
Модели Ministral 3 3B от Mistral AI нужно около 4 GB RAM при рекомендуемой 4-битной квантизации (загрузка 1.8 GB). Проверка вашего железа — ниже: мгновенно, ничего не покидает ваш браузер. Ожидайте примерно ~168 tok/s на NVIDIA RTX 3060 12GB.
Считываем характеристики вашего железа…
Заметки из практики
Ministral 3 3B — это ответ Mistral на вопрос «какой минимальный размер модели всё ещё ощущается как настоящий ассистент?». При 3B параметров она создана для чата и лёгких задач со зрением на железе, которое у вас уже есть. 4-битная квантизация занимает около 1.8 GB, а сборку q2 можно ужать до 1.3 GB, если совсем впритык. С минимумом в 4 GB RAM она работает на бюджетном ноутбуке, старой видеокарте на 4 GB или любом Mac на Apple Silicon — о памяти можно вообще не думать. Это та модель, к которой тянешься, когда модель побольше попросту не помещается.
В повседневной работе главное — скорость. На RTX 3060 вы увидите примерно 168 токенов в секунду, M-серия Max выдаёт около 192, а 4090 разгоняется до ~471 — всё это намного быстрее, чем вы успеваете читать, так что ответы кажутся мгновенными. Даже на одном CPU с DDR5 выходит около 28 tok/s, чего хватает для пакетной обработки. Контекстное окно щедрое — 256K, но относитесь к нему как к потолку. Заполнять его дорого: при 128K контекста суммарная нагрузка на память поднимается примерно до 12.6 GB, заметно выше собственного объёма модели, поэтому на слабых машинах держите рабочий контекст скромным.
Честно говоря, на 3B вы меняете часть глубины на эту скорость и крошечный объём. Mistral 7B обычно держится лучше на более сложных рассуждениях и длинных цепочках инструкций, а Mistral Nemo 12B уходит ещё дальше вперёд, если есть запас памяти. Сильная сторона Ministral 3 3B — сочетание чистой пропускной способности и того, что она ещё и работает со зрением, чего более крупные чат-ориентированные Mistral не умеют. Она поставляется под Apache 2.0, так что её можно использовать коммерчески без каких-либо ограничений. Для быстрой, бесплатной и универсальной небольшой модели — место своё она оправдывает.
Характеристики
Размер по квантизации
| Квантизация | Бит/вес | Загрузка | Мин. RAM | Качество |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.3 GB | 4 GB | Заметная потеря |
| Q4_K_MРекомендуется | 4.85 | 1.8 GB | 4 GB | Рекомендуется |
| Q5_K_M | 5.65 | 2.1 GB | 6 GB | Высокое |
| Q8_0 | 8.5 | 3.2 GB | 6 GB | Почти оригинал |
| F16 | 16 | 6.0 GB | 12 GB | Оригинал |
Размеры рассчитаны как число параметров × бит на вес; реальные сборки GGUF немного отличаются. · Данные обновлены: 2026-06-11 · Как мы считаем эти цифры →
Память в зависимости от длины контекста
| Контекст | KV-кэш (оценка) | Всего памяти (Q4) |
|---|---|---|
| 4K токенов | ~0.3 GB | ~2.1 GB |
| 8K токенов | ~0.7 GB | ~2.5 GB |
| 32K токенов | ~2.7 GB | ~4.5 GB |
| 128K токенов | ~10.8 GB | ~12.6 GB |
KV-кэш растёт вместе с длиной контекста — модель, которая помещается при 4K, может упереться в нехватку памяти при 32K. Оценки предполагают FP16-кэш с grouped-query attention; реальное потребление зависит от рантайма.
Оценка скорости по железу
| Железо | Пропускная способность | ~Скорость |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~168 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~471 tok/s |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Генерация токенов упирается в пропускную способность памяти: tok/s ≈ пропускная способность × 0,85 ÷ размер модели при Q4. Реальные цифры зависят от рантайма и длины контекста.
Запустите локально
Проще всего через Ollama — одна команда, и можно общаться:
ollama run ministral-3:3b