本地AI · Ollama Official Documentation & Community Sources
使用 Ollama 在本地运行 AI 模型 - 2026
图片: Nakul 来自 Unsplash
Ollama 是一款开源工具,让你能下载、运行和管理本地机器上的大语言模型,其工作方式就像 AI 模型的 Docker:只需一条命令即可拉取模型,它会自动处理量化、内存管理和 GPU 加速。 隐私、成本和控制是人们用 Ollama 运行本地 AI 的三大主要原因,而截至 2026 年 8 月,仅 Llama 3.1 一款模型就已累计被拉取超过 1.12 亿次,该项目也筹集了 8800 万美元资金。
什么是 Ollama?
Ollama 是一款开源工具,让你能下载、运行和管理本地机器上的大语言模型,并自动处理量化、内存管理和 GPU 加速。 Ollama 于 2023 年 7 月 8 日发布,由 Jeffrey Morgan 和 Michael Chiang 开发,采用 MIT 许可证。 Ollama 内置用于运行和管理模型的 REST API,因此既适合命令行使用,也便于程序化集成,十分灵活。
Ollama 拥有一个活跃的模型库,提供数百个模型并定期更新;它跨平台支持 macOS、Windows 和 Linux,并会在可用时自动使用 Apple Silicon、NVIDIA 和 AMD GPU。 隐私、成本和控制是人们不断回到基于 Ollama 的本地 AI 的三大主要原因。
安装与设置
系统要求
确认你的硬件满足最低要求:16 GB 内存、一颗现代 CPU 或具备足够显存的 GPU,以容纳你的目标模型规模。 更细致地说:
- 小模型(1B、3B、7B)最低需要 8GB 内存,但性能可能受影响;若要流畅运行 7B 和 13B 模型,建议 16GB。
- 对于更大的模型(30B、40B、70B),32GB 或更多内存为最佳。
- 支持的 Linux 发行版包括 Ubuntu 22.04/24.04 LTS、Debian 11/12、Fedora 39/40、RHEL 9+、Rocky Linux、AlmaLinux 和 Arch Linux;架构必须为 x86_64(AMD64)或 ARM64(aarch64);强烈建议使用 Linux 内核 5.15 或更新版本。
- Ollama 应用本身的下载体积在 macOS 上约为 180 MB,在 Windows 上安装包约 1.6 GB,在 Linux 上捆绑包约 1.4 GB。
GPU 支持
- Ollama 在 Windows 上支持使用 CUDA 的 NVIDIA GPU 和使用 ROCm 的 AMD GPU;如果你有兼容的 GPU,Ollama 会在大多数情况下自动检测并使用它,无需手动配置。
- 若要为 NVIDIA GPU 加速,必须安装且可正常工作的 NVIDIA 驱动;驱动版本要求 525+,建议 550+。
- 在 Linux 上,NVIDIA 用户需另行安装 CUDA 驱动;通过 ROCm 实现的 AMD GPU 支持通常需要 RX 5000 系列及更新型号。
安装步骤
可通过 Homebrew(macOS)、官方安装脚本(Linux)或 winget(Windows)安装 Ollama。 示例:
- Linux:
curl -fsSL https://ollama.com/install.sh | sh - macOS:
brew install ollama - Windows: 从 ollama.com 下载,或使用
winget install Ollama.Ollama
支持的模型
完整的模型目录可在 ollama.com/library 查看;使用 ollama list 可查看你机器上的模型。
按类别推荐的最佳模型(2026 年):
- 小巧、快速、8GB 内存: Llama 3.2 3B、Phi-3 Mini、Gemma 3 4B
- 16GB 内存的最佳全能选择: Llama 3.1 8B、Qwen 2.5 7B、Mistral 7B
- 高质量、32GB+ / GPU: Gemma 2 27B、Qwen 2.5 32B、Mixtral 8x7B
- 近期发布: 2026 年的重大发布包括阿里巴巴 Qwen3.8-27B(8 月,综合最佳)、Poolside Laguna XS 2.1(7 月)、Google Gemma 4(6 月)以及 DeepSeek V4/Flash(4 月)。
Ollama 默认下载 4 位量化版本,这就是为什么一款“70B”模型能装进一台不错的 workstation,而“8B”模型能在笔记本上运行。
优点
- 零成本且开源: Ollama 是免费开源的,采用 MIT 许可证;项目本身没有付费层级,不过你需要为运行它的硬件付费。
- 完全的隐私: 你的数据始终留在自己的机器上。 不依赖云端,也没有按 token 计费。
- 快速上手: 在自己机器上跑起一个可用的语言模型用不到十分钟。
- 兼容 OpenAI: Ollama 内置对 OpenAI Chat Completions API 的兼容性,使得更多工具和应用可以本地配合 Ollama 使用。
- 自动 GPU 加速: 如果你有兼容的 GPU,Ollama 会自动检测并使用它。
- 多种交互方式: 用户可以从命令行运行模型、通过本地 HTTP API 与之交互,或使用面向 Python 和 JavaScript 的客户端库。
缺点
- 命令行优先的方式: 每一次交互都需要终端命令;没有图形界面,没有可视化的模型浏览器,也没有点选式的简便操作。
- 对非技术用户学习曲线陡峭: Ollama 仅依赖命令行界面,学习曲线陡峭,对于偏好可视化模型管理的新手或非技术用户尤其如此。
- 没有内置聊天 UI: Ollama 不包含图形聊天界面;你需要通过终端命令交互,或安装并配置第三方网页界面。
- 企业级功能有限: Ollama 缺乏全面的企业级功能,例如大规模部署支持、协作工具和安全工具;它不适合基础设施复杂或有大量合规要求的公司。
- 性能慢于云端: 本地模型运行速度明显慢于云端替代方案,基础输出需等待 10 至 30 秒。
- 自定义能力有限: Ollama 以牺牲自定义换取简洁;如果你喜欢对模型的每个细节进行微调,Ollama 可能会让你觉得过于受限。
- 不内置对话历史: Ollama 本身不保存对话历史;你只能使用管理历史的外部 UI,否则关闭终端后对话就会丢失。
最佳使用场景
- 本地开发与原型设计: 当你想在自己的硬件上私密地运行 LLM 时--用于离线工作、敏感数据、本地原型设计,或作为应用背后的零成本推理后端--可以使用 Ollama。
- 代码辅助与 RAG 流水线: Ollama 能以每秒 30 至 60 个 token 的速度流畅处理 7B-14B 模型,足以用于代码辅助、聊天和 RAG 流水线。
- 对隐私要求极高的工作流: 数据隐私强制要求、不可预测的 API 定价,以及日益增长的离线工作流需求,都在推动其采用。
- 应用中嵌入 AI: 通过实现 OpenAI 接口,Ollama 让自己成为所有面向 OpenAI API 构建的工具生态的即插即用后端,而无需这些工具明确支持 Ollama。
常见问题
Ollama 完全免费吗?
是的,Ollama 免费开源,采用 MIT 许可证。 Ollama 完全免费,软件本身没有订阅费、使用限制或隐藏费用。
Ollama 与 OpenAI 等云端 AI API 有什么区别?
Ollama 以前沿模型的质量换取隐私、离线使用和零按 token 成本;硬件由你自己提供。 Ollama 非常适合本地开发,但它不能替代托管的 AI API 网关,除非你的应用能够容忍本地运行时的各种限制。
我能否将 Ollama 兼容 OpenAI 的 API 用于现有代码?
OpenAI Python SDK 可通过设置 base_url='http://localhost:11434/v1' 和 api_key='ollama' 来配合 Ollama 使用,将所有 API 调用重定向到你本地的 Ollama 实例,而应用其余部分无需任何代码改动。 你可以在开发期间用真正的 OpenAI API 做原型,再以极小的代码改动切换到 Ollama 用于生产或对隐私敏感的部署。
在普通笔记本(8-16GB 内存)上应该运行哪些模型?
在任何 8GB 内存的笔记本上,运行 Llama 3.2 3B、Phi-3 Mini 或 Gemma 3 4B;对于 16GB 内存(最佳全能配置),使用 Llama 3.1 8B、Qwen 2.5 7B 或 Mistral 7B。