Reupload
电脑检测
返回首页

本地AI · Meta Llama Official Blog & Hugging Face Model Cards

Llama 3.2:开放权重视觉模型与轻量级模型

Llama 3.2:开放权重视觉模型与轻量级模型

图片: Milad Fakurian 来自 Unsplash

Llama 3.2 是一套模型系列,既包含轻量级的纯文本 1B 和 3B 参数模型,也包含 11B 和 90B 参数的视觉语言模型。这些模型涵盖从适合边缘设备的纯文本模型到能够执行复杂推理任务的多模态变体。Llama 3.2 针对本地部署和云端推理都进行了优化,代表着 Meta 推动 AI 在各类设备层级上普及的努力。

什么是 Llama 3.2?

Llama 3.2 是一个具有突破性的语言模型家族,具备增强的能力、更广泛的适用性以及多模态图像支持。本次发布包括中小型视觉大语言模型(11B 和 90B),以及可装入边缘设备和移动设备的轻量级纯文本模型(1B 和 3B),均提供预训练版和指令微调版。

11B 和 90B 是首批支持视觉任务的 Llama 模型,采用了一种新的模型架构,将图像编码器的表示整合进语言模型中。1B 和 3B 模型在发布首日即支持高通和联发科硬件,并针对 Arm 处理器进行了优化。

可用规模与变体

Llama 3.2 系列提供多种规模的模型,从适合边缘设备的轻量级纯文本 1B 和 3B 参数模型,到能够执行复杂推理任务(包括对高分辨率图像的多模态支持)的小型和中型 11B 和 90B 参数模型。

纯文本模型(预训练版和指令微调版):

  • Llama 3.2 1B 包含 12.3 亿参数;3B 包含 32.1 亿参数
  • 两者均提供 BF16 和量化变体(INT4/INT8)
  • 量化指令版上下文长度缩短为 8k

视觉语言模型(多模态):

  • 11B 和 90B 视觉变体,用于图像理解和文本生成
  • 11B 基础模型支持 448 的切片尺寸,而指令版和 90B 模型使用 560 的切片尺寸

硬件要求

用于推理(纯文本 1B/3B 模型):

  • 3B 模型进行 FP16 推理需要约 7 GB 显存
  • 量化为 INT4 后,3B 模型需要约 1.8 GB 显存,因此可以装入 24 GB 的 RTX 4090,并留有小批量处理的余量
  • 推荐:支持 CUDA 的 GPU(16GB 显存或更高);内存:至少 32GB(更大模型需 64GB)
  • 模型及依赖项至少需要 50GB 可用磁盘空间

用于视觉模型(11B/90B):

  • 视觉模型需要明显更多的资源;本地部署建议使用量化(INT4/QLoRA)

CPU/系统:

  • 操作系统:Linux(首选)、macOS 或 Windows;Python:3.8 或更高版本;CUDA Toolkit:GPU 加速所需(11.6 或更新版本)

基准测试亮点

在使用思维链提示的 MMLU 测试中,Llama 3.2 90B 得分为 86.0,略微超过 Claude 3 Haiku,并接近 GPT-4o-mini。

在 MMLU(5-shot)上,Llama 3.2 3B 得分为 63.4,超过 Gemma 2B IT 的 57.8。在 GPQA(0-shot,CoT)上,Llama 3.2 90B 得分为 46.7,优于 Claude 3 Haiku,但落后于 GPT-4o-mini。

在 IFEval 测试中,Llama 3.2 3B 取得了令人瞩目的 77.4 分,击败了 Gemma 2B IT(61.9)和 Phi-3.5-mini IT(59.2)。在 MGSM 多语言基准测试中,Llama 3.2 90B 得分为 86.9,表现稳健,与 GPT-4o-mini 的 87.0 相当。

如何在本地运行

使用 Ollama(最快的方法):

对于最受欢迎的 3B 模型:

ollama run llama3.2:3b

对于 1B 模型(更轻量):

ollama run llama3.2:1b

其他本地运行工具:

  • LM Studio - 提供带有内置模型搜索和管理功能的图形界面
  • Jan - 针对对话用途优化的精简界面
  • GPT4All - 支持一键下载模型的桌面应用
  • Msty - 具备提示模板和历史记录管理功能的全功能客户端

所有这些应用都在其默认模型目录中收录了 Llama 3.2,并自动处理量化变体。

手动设置(进阶):

模型使用多达 9 万亿 token 进行训练,支持 128k token 的长上下文长度。从 Hugging Face 下载 BF16 或量化权重(meta-llama/Llama-3.2-1B、meta-llama/Llama-3.2-3B 等),并使用 transformers + torch,或使用 vLLM 等专用框架进行优化服务。

最佳使用场景

纯文本模型(1B/3B):

  • 设备端使用场景,如摘要、指令遵循和改写任务,在边缘本地运行
  • 提示改写、多语言知识检索、摘要任务、工具使用以及本地运行的助手
  • 移动端 AI 驱动的写作助手
  • 个人知识管理系统
  • 在手机、平板电脑和智能设备上的实时处理

视觉模型(11B/90B):

  • 视觉推理和图像理解任务,超越 Claude 3 Haiku 等闭源模型
  • 文档分析(图表、图形、财务报告)
  • 图像描述和视觉定位
  • 多模态文档理解与搜索

常见问题

我可以将 Llama 3.2 用于商业用途吗?

Llama 3.2 依据一份非独占、全球性、不可转让且免版税的有限许可授权,允许使用、复制、分发、拷贝、创建衍生作品以及修改。如果月活跃用户超过 7 亿,则需要与 Meta 签订单独的商业协议,这可能涉及费用或基于使用量的版税。

支持多长的上下文长度?

所有 Llama 3.2 模型都支持 128K 的上下文长度,延续了 Llama 3.1 引入的扩展 token 容量。请注意,量化指令版的上下文长度缩短为 8k。

我应该为我的设备选择哪种模型规模?

对于 RTX 4090 等消费级 GPU 上的推理,3B 模型在 FP16 下需要 7GB,但量化为 INT4 后仅需 1.8GB。若追求在手机/边缘设备上的最大便携性,请选择 1B;若有 2GB 以上可用资源并希望获得更好质量,请选择 3B。对于拥有 8GB 以上显存的台式机,可使用全精度的 3B 或量化的 11B 视觉模型。

多模态模型是否有限制?

就多模态模型而言,如果你是居住在欧盟的个人,或主要营业地位于欧盟的公司,则不会获得 Llama 3.2 社区许可协议授予的权利。此限制不适用于集成了这些多模态模型的产品或服务的最终用户。

想知道你的电脑能否运行本地AI吗?