本地AI · Mistral AI, Hugging Face, ArXiv
Mistral 与 Mixtral:运行开放权重大语言模型
图片: Sandip Kalal 来自 Unsplash
Mistral AI 于 2023 年 12 月发布了其首个开放 MoE 模型,凭借高效的语言模型树立了声望,其表现远超其参数规模。Mixtral 8x7B 包含 467 亿总参数,但推理速度和成本与规模仅为其三分之一的模型相当,更新版本仍在 Apache 2.0 许可下提供,可在消费级硬件上实现私密、可定制的 AI 部署。
什么是 Mistral / Mixtral?
Mistral Large 3 是世界上最好的宽松开放权重模型之一,也是 Mistral 自开创性的 Mixtral 系列以来首个专家混合模型。Mistral 家族既包括稠密模型(7B、24B、128B),也包括稀疏的专家混合(MoE)变体。Mixtral 8x7B 使用 8 个各含 70 亿参数的专家网络,每个 token 仅激活 2 个专家,这意味着你获得约 130 亿活跃参数,同时受益于 470 亿总参数。
Mixtral 模型家族采用稀疏专家混合(SMoE)架构,由路由器为每个 token 选择一部分专家网络进行处理。这种设计带来了卓越的效率:Mixtral 8x7B 的质量接近 70B 稠密模型,但推理成本仅相当于 13B 模型。
可用规模与变体
开放权重的 Mistral / Mixtral 产品线包括:
- Mistral 7B - 一个拥有 70 亿参数的预训练生成式文本模型,提供基础版和指令版变体
- Mixtral 8x7B - 467 亿总参数,推理速度和成本与规模仅为其三分之一的模型相同,上下文长度为 32k token
- Mixtral 8x22B - 稀疏专家混合模型,1410 亿总参数中有 390 亿活跃参数,具备 64K token 的上下文窗口
- Mistral Small 3.1 - 240 亿参数,具备最先进的视觉理解能力和 128k token 上下文能力
- Mistral Large 3 - 最先进的通用多模态细粒度专家混合模型,拥有 410 亿活跃参数和 6750 亿总参数
所有开放权重变体均在 Apache 2.0 许可下发布,允许不受限制的研究和商业使用。
硬件要求
显存需求因模型规模和量化方式而差异显著:
- Mistral 7B:使用 Q4 或 Q5 量化时为 6-8GB 显存
- Mixtral 8x7B:Q4 量化需 24GB 显存(权重约 28.4 GB,可部分卸载)
- Mixtral 8x22B:Q4 需 48GB+ 显存(权重约 85.9 GB,总计约 97 GB)
MoE 模型必须将所有专家都保存在显存中,即使每个 token 只激活少数几个。Mixtral 8x7B 在 4 位量化下大约需要 28GB,可装入单张 NVIDIA RTX 5090 32GB。
在系统级规格方面:最低 16 GB 内存(推荐 32 GB),任何现代 8 核 CPU,以及 100-500 GB 可用空间的 NVMe SSD 用于模型文件。Mac(Apple Silicon)凭借统一内存和 MLX 运行时表现出色,Windows 最好搭配 NVIDIA + CUDA,Linux 则提供最广泛的 GPU 灵活性,包括 AMD ROCm 支持。
基准测试亮点
Mixtral 8x7B 在十二项基准中的九项上超越了 Llama 2 70B。更具体地说,Mixtral 在法语、德语、西班牙语和意大利语上显著优于 Llama 2 70B。
Mixtral 8x7B 在 MMLU 上达到约 70%,明显优于 Mistral 7B。Mixtral 可处理 32k token 的上下文,在代码生成方面展现出强大特性,拥有 467 亿总参数但每个 token 仅使用 129 亿参数,兼顾了速度和成本效率。
Mistral 8x7B 在近期基准测试中排名 43.1,落后于 Mistral Large 3(45.7)和 Ministral 3 14B Reasoning(47.3)。在前沿能力方面,Mistral Large 3 在通用提示上与最佳的指令微调开放权重模型旗鼓相当,同时展现出图像理解能力以及在多语言对话上的同类最佳表现,在 LMArena 排行榜的 OSS 非推理模型类别中首次亮相即位列第 2。
如何在本地运行
最简单的途径是 Ollama,一个以命令行为先的运行时,配有轻量级后台服务器和与 OpenAI 兼容的 API。从 ollama.com 安装,然后运行:
ollama run mixtral:8x7b
对于 8x22B 变体,请使用:ollama run mixtral:8x22b。Ollama 的模型库列出了 200 多个可直接运行的模型,涵盖 Llama、Qwen、DeepSeek、Mistral、Gemma 以及 OpenAI 的开放权重 gpt-oss 系列,每个都预先配置了正确的提示模板。
其他工具也支持 Mistral / Mixtral 模型:
- LM Studio - 精致的桌面图形界面,面向更愿意浏览和点击而不愿输入命令的用户,同时它也运行本地 API 服务器
- Jan - 最受欢迎、外观最漂亮的本地大语言模型应用之一,是 ChatGPT 的隐私优先替代方案
- GPT4All - 三者中最面向初学者的,拥有精心挑选的、较小的模型列表和更简单的一键安装体验
Ollama 构建在 llama.cpp 之上,凭借智能内存管理以及对 NVIDIA(CUDA)、Apple Silicon(Metal)和 AMD(ROCm)GPU 的高效加速,提供出色的每秒 token 吞吐量。
最佳使用场景
Mixtral 8x7B 非常适合文本摘要、问答、文本分类、文本补全和代码生成。Mistral 7B 支持文本摘要、分类、文本补全和代码补全。
代码与技术任务:Mistral 7B 在代码任务上接近 CodeLlama 7B 的性能,同时在英语语言任务上仍然能力出众。Mixtral 8x22B 在 1410 亿参数中仅使用 390 亿活跃参数,提供无与伦比的成本效率,具备强大的数学和编码能力以及原生函数调用。
文档处理与 RAG:Mixtral 8x22B 的 64K token 上下文窗口可从大型文档中精确回忆信息,使其非常适合检索增强生成和长文档摘要。
多语言工作流:Mixtral 8x22B 具备原生多语言能力,在法语、德语、西班牙语和意大利语的 HellaSwag、Arc Challenge 和 MMLU 基准测试中大幅超越 LLaMA 2 70B。
生产推理:Mixtral 8x7B 非常适合需要开放权重模型进行定制或微调,且计算资源或延迟有限的生产环境。
常见问题
我可以在游戏 PC 上运行 Mixtral 8x7B 吗?
可以,但有一些前提条件。Mixtral 8x7B 在 4 位量化下大约需要 28GB,可装入单张 NVIDIA RTX 5090 32GB。像 RTX 3090(24GB)这样的较旧显卡需要层卸载技术。如果你有 8GB 显存,请先从 Mistral 7B 开始;它量化后约为 4.4 GB。
稠密的 Mistral 7B 和稀疏的 Mixtral 8x7B 哪个更快?
Mixtral 8x7B 的质量接近 70B 稠密模型,但推理成本仅相当于 13B 模型,因为 8 个专家中每个 token 仅激活 2 个。Mistral 7B 更小、加载更快,但得益于其稀疏架构,Mixtral 在速度相当的情况下提供了更好的质量。
Mistral 模型商业使用安全吗?
安全。基础版和指令微调版均在 Apache 2.0 许可下发布,为企业界和开发者社区的进一步定制提供了坚实基础。研究和生产使用均不受许可限制。
Mixtral 8x22B 与 Mistral Large 3 相比如何?
Mixtral 8x22B 已于 2025 年 3 月退役,新集成推荐使用 Mistral Small 4。Mistral Large 3 是最先进的通用多模态专家混合模型,拥有 410 亿活跃参数和 6750 亿总参数,性能更优,但需要 48GB+ 显存。对于消费级硬件上的本地部署,Mixtral 8x7B 或 Mistral Small 3.1 仍是实用的最佳选择。
来源与版权