← 全部模型模型检测

我能跑 Mistral 7B 吗?

Mistral AI 的 Mistral 7B 在推荐的 4 位量化下大约需要 8 GB 内存(下载体积 4.4 GB)。下方即时检测您的硬件 — 数据不会离开您的浏览器。 在 NVIDIA RTX 3060 12GB 上预计可达约 ~70 tok/s。

正在读取您的硬件信号…

实际使用笔记

Mistral 7B 是第一个证明小体积开源权重 LLM 真正实用的模型,至今仍是搭建轻量级本地聊天助手的稳妥之选。在 4-bit 量化下体积约为 4.4 GB,因此能在 8 GB 显存的 GPU 上轻松装下并留有余量,在任意 Apple Silicon Mac 的统一内存中也能流畅运行;如果你要把它塞进更老的硬件,约 3 GB 的 2-bit 版本同样可行。它采用 Apache 2.0 许可证,宽松程度几乎到顶:可免费商用,不附带任何厂商限制。

日常使用中,它在聊天和短文摘要上既快又稳。在 RTX 4090 上 4-bit 可达约 196 tok/s,即便是入门级的 RTX 3060 12GB 也能保持在 70 tok/s 左右,比你的阅读速度还快;M 系列 Max 则接近 80 tok/s。32K 的上下文窗口够用但不算大,一旦把它填满,总内存占用会升到约 8.4 GB,所以在仅有 8 GB 显存的显卡上,最好控制实际使用的上下文长度,而不是把整个窗口塞满。

需要坦诚指出的短板是它的年龄:该模型于 2023 年底发布,在更难的推理和指令遵循上已落后于更新的小模型;如果内存允许,Mistral Nemo 12B 通常能更好地应对更长、更苛刻的提示词。专门做编程的话,同等体积下 Qwen 2.5 Coder 7B 往往是更强的选择。Mistral 7B 至今仍占优的地方在于简单和普及度:它体积极小、在 Apache 2.0 下完全开源,并且围绕朴素的 'mistral' Ollama 标签积累了多年的工具生态,是一个可靠、不会有意外的基准选择。

规格参数

参数量7.2B
上下文窗口32K tokens
厂商Mistral AI
许可证Apache 2.0
发布时间2023-09
擅长领域聊天

各量化版本体积

量化位/权重下载体积最低内存质量
Q2_K3.353.0 GB6 GB损失明显
Q4_K_M推荐4.854.4 GB8 GB推荐
Q5_K_M5.655.1 GB8 GB
Q8_08.57.7 GB12 GB接近原版
F161614.4 GB24 GB原版

体积按参数量 × 位/权重估算,实际 GGUF 版本会略有差异。 · 数据更新于: 2026-06-11 · 这些数字是怎么算出来的 →

不同上下文长度的内存需求

上下文KV 缓存(估算)总内存(Q4)
4K tokens~0.5 GB~4.9 GB
8K tokens~1.0 GB~5.4 GB
32K tokens~4.0 GB~8.4 GB

KV 缓存会随上下文长度增长 — 4K 下装得下的模型,到 32K 可能就内存不足了。估算基于 FP16 缓存并采用 grouped-query attention;实际占用因运行时而异。

不同硬件的预估速度

硬件带宽约·速度
NVIDIA RTX 3060 12GB360 GB/s~70 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~196 tok/s
Apple M-series (base)100 GB/s~19 tok/s
Apple M-series Pro270 GB/s~53 tok/s
Apple M-series Max410 GB/s~80 tok/s
CPU only (dual-channel DDR5)60 GB/s~12 tok/s

Token 生成速度受内存带宽限制:tok/s ≈ 带宽 × 0.85 ÷ Q4 下的模型体积。实际数值因运行时和上下文长度而异。

在本地运行

最简单的方式是 Ollama — 一条命令即可开聊:

ollama run mistral

常见问题