本地AI · Google AI Developers Blog & Official Documentation
Gemma 2:开放权重模型完整指南
图片: Growtika 来自 Unsplash
Gemma 2 是谷歌可免费下载的大语言模型家族,提供 2B、9B 和 27B 参数规模。这些模型从 Gemini 蒸馏而来,采用知识蒸馏训练,在消费级硬件上高效运行的同时,能够与规模数倍于己的模型展开有竞争力的较量。它以宽松许可发布,并兼容 Ollama、LM Studio 等本地推理工具。
什么是 Gemma 2?
Gemma 2 是谷歌的开放大语言模型家族,提供 2B、9B 和 27B 参数规模。这些轻量级、最先进的开放模型在其规模上提供最佳性能,甚至能与规模为其 2-3 倍的模型形成有竞争力的替代方案。
Gemma 2 2B 是谷歌为资源受限的边缘和移动部署开发的紧凑型开放权重语言模型,从更大型的 Gemini 架构蒸馏而来。Gemma 2 在商业友好的 Gemma 许可下提供,使开发者和研究人员能够分享并商业化其创新成果。
可用规模与变体
Gemma 2 提供 2B、9B 和 27B 参数规模。每种规模都有两个变体:
- 基础模型:预训练的,适合微调和研究
- 指令微调版(IT):针对对话任务和用户交互优化
技术规格
- 上下文长度:所有模型支持 8,192 token 的序列长度。
- 词汇表大小:256,128 个 token(显著大于竞争模型)
- 架构:采用仅解码器设计的稠密 Transformer
- 训练数据:9B 模型的训练语料库包含 8 万亿 token,主要来自网页文档、代码和数学内容。
硬件要求
内存需求(全精度 FP16)
Gemma 2 2B: 1K token 时需 5.76 GB 显存,8K token 时需 6.16 GB 显存。单张 RTX 4090 或同等设备即可轻松应对。
Gemma 2 9B: 全精度通常需要 18-20 GB 显存。像 NVIDIA A100 40GB 或 24GB 显存的 RTX 4090 这样的 GPU 可以以较小的批量大小微调 Gemma 2 2B。
Gemma 2 27B: 在 8,192 token 的全精度(FP16)下,需要 61.44 GB 显存,适合 1 张 NVIDIA A100 80GB、3 张 RTX 4090 24GB 或 1 台 Apple M3 Max 128GB。
量化选项
- INT8 量化:内存减少约一半
- INT4 量化:进一步减至原始大小的 1/4,使笔记本电脑推理成为可能
- GGUF 格式:针对使用 Ollama 及类似工具的 CPU 推理优化
Gemma 2B 在 Q4 量化下(约 1.4GB)可运行在配备 4GB 内存的树莓派 4 上,速度约为每秒 3-5 个 token。
基准测试亮点
Gemma 2 模型在多个评估框架中展现出相对于其参数数量而言卓越的性能。
LMSYS Chatbot Arena(人工评估)
Gemma 27B(Elo 1218)排名高于 Llama 3 70B(Elo 1206),Gemma 9B(Elo 1187)与 GPT-4-0314(Elo 1186)相当,Gemma 2.6B(Elo 1126)排名高于 GPT-3.5-Turbo-0613(Elo 1116)。
学术基准
在 MMLU 基准上,Gemma 2 2B 得分 52.2%,Gemma 2 9B 得分 71.3%,Gemma 2 27B 得分 75.2%。其他得分:
- GSM8K(数学):Gemma 2 9B:68.6%,Gemma 2 27B:74.0%
- HumanEval(代码):Gemma 2 9B:68.2%,Gemma 2 27B:74.9%
- BBH(推理):Gemma 2 9B:68.2%,Gemma 2 27B:74.9%
关键成就
27B 模型迅速攀升 LMSYS Chatbot Arena 排行榜,在引人入胜的真实世界对话中甚至超越了规模为其两倍以上的热门模型,而 Gemma 2 2B 模型在 Chatbot Arena 上超越了所有 GPT-3.5 模型,且其规模可在边缘设备上运行。
如何在本地运行
使用 Ollama(最简单的方法)
Gemma 2 兼容主流 AI 框架,包括 Hugging Face Transformers、JAX、PyTorch、通过 Keras 3.0 的 TensorFlow、vLLM、Gemma.cpp、Llama.cpp 和 Ollama。
安装与使用:
- 从 ollama.com 安装 Ollama
- 运行以下命令之一:
- 2B 参数:ollama run gemma2:2b
- 9B 参数:ollama run gemma2
- 27B 参数:ollama run gemma2:27b
替代工具
其他流行的本地推理平台也支持 Gemma 2:
- LM Studio:从 lmstudio.ai 下载,提供用于模型管理的图形界面
- Jan:具有类似功能的开源替代方案
- GPT4All:具有预配置模型、对初学者友好的界面
- Msty:用于本地大语言模型推理的跨平台桌面应用
所有这些工具都允许你从内置模型目录中下载 Gemma 2 的量化版本并离线运行。
最佳使用场景
Gemma 2 9B 适用于诗歌、文案写作和代码生成等内容创作,其中指令微调变体对对话代理和聊天机器人尤为有效,支持问答和摘要等任务。
理想应用:
- 边缘设备与移动端:2B 模型可在手机和嵌入式系统上高效运行
- 代码生成与辅助:在 HumanEval 和编码基准上表现强劲
- 文档摘要:高质量的生成式与抽取式摘要
- 客服聊天机器人:指令微调变体擅长面向用户的对话
- 本地隐私优先部署:完全掌控数据,无外部 API 调用
- 教育工具:师生问答系统和辅导应用
- 高性价比推理:单 GPU 或 CPU 部署可降低运营成本
常见问题
Gemma 2 可以在没有 GPU 的情况下完全在我的笔记本电脑上运行吗?
Gemma 2 相对较小的规模使其能够部署在资源有限的环境中,例如笔记本电脑、台式机或你自己的云基础设施。2B 模型可在 CPU 上运行,尽管速度会很慢(每秒几个 token)。量化为 INT4 格式可进一步降低内存需求。
Gemma 2 基础模型和指令微调模型有什么区别?
基础模型是预训练的,针对自定义任务的微调进行了优化。指令微调版(IT)变体经过额外训练以遵循用户指令并进行对话,使其无需进一步训练即可立即作为聊天机器人使用。
Gemma 2 是真正的开源吗?
Gemma 模型是"开放权重"而非完全开源--权重可免费获取,但训练数据和代码则不公开。宽松的许可仍允许商业使用和模型权重的再分发。
Gemma 2 与 Llama 3 相比如何?
9B 的 Gemma 2 模型提供了同类领先的性能,超过了 Llama 3 8B 及其规模类别中的其他开放模型。27B 变体尽管更小,却能与大得多的 Llama 3 模型实现有竞争力的性能。