Reupload
电脑检测
返回首页

本地AI · Hugging Face & Alibaba Qwen Official

Qwen 2.5:阿里巴巴开放大语言模型完整指南

Qwen 2.5:阿里巴巴开放大语言模型完整指南

图片: Bhautik Patel 来自 Unsplash

Qwen2.5 是最新的 Qwen 大语言模型系列,提供从 0.5B 到 72B 参数共 7 种规模。这些模型基于 18 万亿 token 训练,支持 29 种以上语言,大多数规模采用 Apache 2.0 许可。得益于这些领域的专业专家模型,Qwen2.5 在编码和数学方面的能力显著提升。

什么是 Qwen 2.5?

Qwen2.5 是最新的 Qwen 大语言模型系列。基于 18 万亿 token 以及包括监督微调和多阶段强化学习在内的精细后训练技术构建,Qwen2.5 代表着阿里巴巴打造可媲美更大型专有系统的有竞争力开放权重模型的努力。

得益于这些领域的专业专家模型,Qwen2.5 在编码和数学方面的能力显著提升。它在指令遵循、长文本生成(超过 8K token)、理解结构化数据(例如表格)以及生成结构化输出(尤其是 JSON 格式)方面展现出显著进步。

可用规模与变体

Qwen2.5 提供 7 种规模的预训练和指令微调模型:0.5B、1.5B、3B、7B、14B、32B 和 72B。一次性发布超过 100 个模型,包括七种参数规模的基础版和指令版变体,以及专门的 Qwen2.5-Coder 和 Qwen2.5-Math 变体,还有 GGUF、AWQ 和 GPTQ 量化版本。

基础模型与指令微调模型:

  • 基础模型是预训练的,适合继续微调
  • 指令微调变体针对聊天和对话进行了优化(推荐大多数用户使用)

专用变体:

  • Qwen2.5-Coder 专为编码应用设计
  • Qwen2.5-Math 提供专门的数学推理微调版,采用思维链 + 工具集成推理流程

许可:

  • 大多数模型采用 Apache 2.0 许可,而 Qwen2.5-3B 和 Qwen2.5-72B 分别受 Qwen Research License 和 Qwen License 管辖

硬件要求

从 0.5B(笔记本电脑/手机/树莓派)到 72B(双 3090 旗舰配置)的范围意味着每种配置都有对应的 Qwen 2.5 变体。以下是常见量化下的典型显存需求:

模型Q4_K_M(推荐)FP16(全精度)最低 GPU
0.5B约 400MB约 1GB树莓派 5 / 手机
1.5B约 1.5GB约 3GB4GB 内存
3B约 2GB约 6GB8GB 内存
7B约 5.5GB约 14GBRTX 4060 (8GB)
14B约 8.5GB约 28GBRTX 4070 (12GB)
32B约 19.5GB约 64GBRTX 4090 (24GB)
72B约 45GB约 144GB双 A100 (40GB)

大多数模型支持 128K(131,072)token 的上下文长度,并可生成最多 8K token,从而能够生成大量文本输出。

量化建议:

  • Q4_K_M 是在质量与显存权衡方面推荐的最佳选择
  • Q8_0 保留更多精度,但需要 2 倍显存
  • Q3/Q2 量化是内存紧张时的应急后备方案

基准测试亮点

Qwen2.5 在各项标准评估中展现出有竞争力的表现:

  • 在 MATH 基准测试上,Qwen2.5-7B/72B-Instruct 的得分从 52.9/69.0 提升至 75.5/83.1
  • Qwen2.5-72B 在 MMLU 和 BBH 等通用任务上表现出色,分别取得 79.7 和 78.2 的分数,超越规模更大的竞争对手
  • Qwen2.5-14B 和 Qwen2.5-32B 超越规模相当或更大的基线模型,在模型规模与能力之间实现了最佳平衡

编码性能:

  • Qwen 2.5-Coder-32B 在 LiveCodeBench 上得分 37.2%,超过 GPT-4o 的 29.2%
  • 72B 模型在 SWE-Bench Verified(真实世界缺陷修复)上的 36.5% 得分超过 GPT-4o 的 23.6% 和 Claude 3.5 Sonnet 的 33.4%

如何在本地运行

使用 Ollama 快速开始:

安装并启动 Qwen2.5-7B:ollama pull qwen2.5:7b

7B 规模是本地机器最受欢迎的选择--它在质量、速度和硬件要求之间取得了平衡。

其他工具: 除 Ollama 外,LM Studio 为本地模型提供类似 ChatGPT 的界面。其他选项包括:

  • Jan - 简洁的桌面界面
  • GPT4All - 一键模型管理
  • Msty - 轻量级替代方案

所有工具安装后均可直接从 Hugging Face 拉取模型。

直接 Python 集成: 对于自定义工作流,可通过 Hugging Face Transformers 加载任意模型:

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")

最佳使用场景

  • 多语言支持(29 种以上语言): Qwen2.5 支持 29 种以上语言,包括中文、英语、法语、西班牙语、葡萄牙语、德语、意大利语、俄语、日语、韩语、越南语、泰语和阿拉伯语。非常适合国际团队。

  • 边缘与移动部署: 即使只有 30 亿参数的模型如今也能提供极具竞争力的结果。0.5B 和 1.5B 规模可运行在手机和嵌入式设备上。

  • 代码生成与修复: Qwen2.5-Coder 变体超越更大的开放模型。可用于实现类似 GitHub Copilot 的功能,而无需依赖专有云服务。

  • 长上下文检索(RAG): 具有 128K 上下文的 3B 模型是罕见的配置--大多数 5B 以下模型的上下文上限为 8-32K--这使 Qwen 2.5 3B 成为设备端 RAG 工作流(其中检索到的上下文可能很长)的可信候选者。

  • 隐私关键型应用: 本地运行 Qwen 可确保隐私并消除 API 成本。

常见问题

我应该为我的笔记本电脑选择哪种 Qwen 2.5 规模?

Qwen2.5-7B 需要约 5.5GB 显存,在 RTX 4060/4070 上大约以每秒 60-75 个 token 的速度运行。如果你有 8GB 显存的 GPU,7B 模型是理想选择。对于 12GB 以上显存,14B 变体在速度略慢的情况下提供明显更好的质量。

Qwen 2.5 是真正的开源吗?

大多数模型采用 Apache 2.0 许可,而 Qwen2.5-3B 和 Qwen2.5-72B 分别受 Qwen Research License 和 Qwen License 管辖。Apache 2.0 允许商业使用;另外两种许可在研究以及部分受限的商业使用上予以许可--在商业部署前请查阅 Hugging Face 上的许可条款。

Qwen 2.5 与 Llama 3.1 相比如何?

Qwen 2.5 72B 在多项基准测试中以五分之一的活跃参数超越了 Llama 3.1 405B。Meta 的 405B 发布时是最大的开放旗舰模型,但 Qwen 2.5 有实证表明在许多标准测试上表现更佳。

我可以在 Mac 上运行 Qwen 2.5 吗?

可以。任何配备 18 GB 或更多统一内存的 M 系列 Mac 都能以 Q5_K_M 或更高量化运行 Qwen2.5-Coder 14B。M4 Pro 24GB 在 Q6_K 下能提供出色体验,并有余量留给上下文。基础版 Qwen2.5 模型的要求相近或更低。

想知道你的电脑能否运行本地AI吗?

来源与版权

原始来源: Hugging Face & Alibaba Qwen Official