Reupload
电脑检测
返回首页

本地AI · Ollama Official Documentation & Community Sources

使用 Ollama 在本地运行 AI 模型 - 2026

使用 Ollama 在本地运行 AI 模型 - 2026

图片: Nakul 来自 Unsplash

Ollama 是一款开源工具,让你能下载、运行和管理本地机器上的大语言模型,其工作方式就像 AI 模型的 Docker:只需一条命令即可拉取模型,它会自动处理量化、内存管理和 GPU 加速。 隐私、成本和控制是人们用 Ollama 运行本地 AI 的三大主要原因,而截至 2026 年 8 月,仅 Llama 3.1 一款模型就已累计被拉取超过 1.12 亿次,该项目也筹集了 8800 万美元资金。

什么是 Ollama?

Ollama 是一款开源工具,让你能下载、运行和管理本地机器上的大语言模型,并自动处理量化、内存管理和 GPU 加速。 Ollama 于 2023 年 7 月 8 日发布,由 Jeffrey Morgan 和 Michael Chiang 开发,采用 MIT 许可证。 Ollama 内置用于运行和管理模型的 REST API,因此既适合命令行使用,也便于程序化集成,十分灵活。

Ollama 拥有一个活跃的模型库,提供数百个模型并定期更新;它跨平台支持 macOS、Windows 和 Linux,并会在可用时自动使用 Apple Silicon、NVIDIA 和 AMD GPU。 隐私、成本和控制是人们不断回到基于 Ollama 的本地 AI 的三大主要原因。

安装与设置

系统要求

确认你的硬件满足最低要求:16 GB 内存、一颗现代 CPU 或具备足够显存的 GPU,以容纳你的目标模型规模。 更细致地说:

  • 小模型(1B、3B、7B)最低需要 8GB 内存,但性能可能受影响;若要流畅运行 7B 和 13B 模型,建议 16GB。
  • 对于更大的模型(30B、40B、70B),32GB 或更多内存为最佳。
  • 支持的 Linux 发行版包括 Ubuntu 22.04/24.04 LTS、Debian 11/12、Fedora 39/40、RHEL 9+、Rocky Linux、AlmaLinux 和 Arch Linux;架构必须为 x86_64(AMD64)或 ARM64(aarch64);强烈建议使用 Linux 内核 5.15 或更新版本。
  • Ollama 应用本身的下载体积在 macOS 上约为 180 MB,在 Windows 上安装包约 1.6 GB,在 Linux 上捆绑包约 1.4 GB。

GPU 支持

  • Ollama 在 Windows 上支持使用 CUDA 的 NVIDIA GPU 和使用 ROCm 的 AMD GPU;如果你有兼容的 GPU,Ollama 会在大多数情况下自动检测并使用它,无需手动配置。
  • 若要为 NVIDIA GPU 加速,必须安装且可正常工作的 NVIDIA 驱动;驱动版本要求 525+,建议 550+。
  • 在 Linux 上,NVIDIA 用户需另行安装 CUDA 驱动;通过 ROCm 实现的 AMD GPU 支持通常需要 RX 5000 系列及更新型号。

安装步骤

可通过 Homebrew(macOS)、官方安装脚本(Linux)或 winget(Windows)安装 Ollama。 示例:

  • Linux: curl -fsSL https://ollama.com/install.sh | sh
  • macOS: brew install ollama
  • Windows: 从 ollama.com 下载,或使用 winget install Ollama.Ollama

支持的模型

完整的模型目录可在 ollama.com/library 查看;使用 ollama list 可查看你机器上的模型。

按类别推荐的最佳模型(2026 年):

  • 小巧、快速、8GB 内存: Llama 3.2 3B、Phi-3 Mini、Gemma 3 4B
  • 16GB 内存的最佳全能选择: Llama 3.1 8B、Qwen 2.5 7B、Mistral 7B
  • 高质量、32GB+ / GPU: Gemma 2 27B、Qwen 2.5 32B、Mixtral 8x7B
  • 近期发布: 2026 年的重大发布包括阿里巴巴 Qwen3.8-27B(8 月,综合最佳)、Poolside Laguna XS 2.1(7 月)、Google Gemma 4(6 月)以及 DeepSeek V4/Flash(4 月)。

Ollama 默认下载 4 位量化版本,这就是为什么一款“70B”模型能装进一台不错的 workstation,而“8B”模型能在笔记本上运行。

优点

  • 零成本且开源: Ollama 是免费开源的,采用 MIT 许可证;项目本身没有付费层级,不过你需要为运行它的硬件付费。
  • 完全的隐私: 你的数据始终留在自己的机器上。 不依赖云端,也没有按 token 计费。
  • 快速上手: 在自己机器上跑起一个可用的语言模型用不到十分钟。
  • 兼容 OpenAI: Ollama 内置对 OpenAI Chat Completions API 的兼容性,使得更多工具和应用可以本地配合 Ollama 使用。
  • 自动 GPU 加速: 如果你有兼容的 GPU,Ollama 会自动检测并使用它。
  • 多种交互方式: 用户可以从命令行运行模型、通过本地 HTTP API 与之交互,或使用面向 Python 和 JavaScript 的客户端库。

缺点

  • 命令行优先的方式: 每一次交互都需要终端命令;没有图形界面,没有可视化的模型浏览器,也没有点选式的简便操作。
  • 对非技术用户学习曲线陡峭: Ollama 仅依赖命令行界面,学习曲线陡峭,对于偏好可视化模型管理的新手或非技术用户尤其如此。
  • 没有内置聊天 UI: Ollama 不包含图形聊天界面;你需要通过终端命令交互,或安装并配置第三方网页界面。
  • 企业级功能有限: Ollama 缺乏全面的企业级功能,例如大规模部署支持、协作工具和安全工具;它不适合基础设施复杂或有大量合规要求的公司。
  • 性能慢于云端: 本地模型运行速度明显慢于云端替代方案,基础输出需等待 10 至 30 秒。
  • 自定义能力有限: Ollama 以牺牲自定义换取简洁;如果你喜欢对模型的每个细节进行微调,Ollama 可能会让你觉得过于受限。
  • 不内置对话历史: Ollama 本身不保存对话历史;你只能使用管理历史的外部 UI,否则关闭终端后对话就会丢失。

最佳使用场景

  • 本地开发与原型设计: 当你想在自己的硬件上私密地运行 LLM 时--用于离线工作、敏感数据、本地原型设计,或作为应用背后的零成本推理后端--可以使用 Ollama。
  • 代码辅助与 RAG 流水线: Ollama 能以每秒 30 至 60 个 token 的速度流畅处理 7B-14B 模型,足以用于代码辅助、聊天和 RAG 流水线。
  • 对隐私要求极高的工作流: 数据隐私强制要求、不可预测的 API 定价,以及日益增长的离线工作流需求,都在推动其采用。
  • 应用中嵌入 AI: 通过实现 OpenAI 接口,Ollama 让自己成为所有面向 OpenAI API 构建的工具生态的即插即用后端,而无需这些工具明确支持 Ollama。

常见问题

Ollama 完全免费吗?

是的,Ollama 免费开源,采用 MIT 许可证。 Ollama 完全免费,软件本身没有订阅费、使用限制或隐藏费用。

Ollama 与 OpenAI 等云端 AI API 有什么区别?

Ollama 以前沿模型的质量换取隐私、离线使用和零按 token 成本;硬件由你自己提供。 Ollama 非常适合本地开发,但它不能替代托管的 AI API 网关,除非你的应用能够容忍本地运行时的各种限制。

我能否将 Ollama 兼容 OpenAI 的 API 用于现有代码?

OpenAI Python SDK 可通过设置 base_url='http://localhost:11434/v1' 和 api_key='ollama' 来配合 Ollama 使用,将所有 API 调用重定向到你本地的 Ollama 实例,而应用其余部分无需任何代码改动。 你可以在开发期间用真正的 OpenAI API 做原型,再以极小的代码改动切换到 Ollama 用于生产或对隐私敏感的部署。

在普通笔记本(8-16GB 内存)上应该运行哪些模型?

在任何 8GB 内存的笔记本上,运行 Llama 3.2 3B、Phi-3 Mini 或 Gemma 3 4B;对于 16GB 内存(最佳全能配置),使用 Llama 3.1 8B、Qwen 2.5 7B 或 Mistral 7B。

想知道你的电脑能否运行本地AI吗?