本地AI · Microsoft Foundry Labs + Hugging Face
Phi-4:微软强大的 14B 推理模型
图片: Shubham Dhage 来自 Unsplash
Phi-4 是微软的 140 亿参数小型语言模型,基于 9.8 万亿 token 的精选合成与真实数据训练,在推理和数学基准测试上取得卓越表现。它提供多种规模(14B、3.8B mini、5.6B 多模态),可通过 Ollama、LM Studio 等工具在消费级硬件上本地运行,并采用 MIT 许可,允许商业使用。
什么是 Phi-4?
Phi-4 是微软的 140 亿参数小型语言模型,基于约 9.8 万亿 token 的合成"教科书式"数据,并结合经过滤的公开文档和精选学术材料进行训练。该模型通过监督微调和直接偏好优化进行对齐,具有 16K token 的上下文窗口。
Phi-4 在 MIT 许可下发布,可自由用于商业和研究目的。该模型专为在内存受限环境中进行推理、数学和代码生成而设计,在 MMLU 上达到 84.8%,在 MATH 上达到 80.4%,在 HumanEval 上达到 82.6%。
可用规模与变体
Phi-4 家族包含三个主要模型:
- Phi-4 (14B) - 旗舰模型,针对复杂推理和数学问题求解优化,具有 16K token 的上下文窗口。
- Phi-4-mini (3.8B) - 针对推理和 128K 上下文任务优化。该模型具有 200,000 词的词汇表,支持更强的多语言能力、分组查询注意力、内置函数调用、改进的指令遵循以及共享嵌入。
- Phi-4-multimodal (5.6B) - 在单一架构中统一语音、视觉和文本。它支持文本、音频和图像作为输入,并返回文本作为输出。
此外,微软还发布了针对高级数学和逻辑任务优化的专门推理变体。
硬件要求
基于 GPU 的推理(推荐):
- Phi-4 (14B) 在 Q4_K_M 下需要约 9 GB 显存。在 Q8 下需要约 14 GB。在 FP16 下需要约 28 GB。
- Phi-4-mini (3.8B) 在 Q4_K_M 下仅需约 2.5 GB--可装入任何 GPU 或仅用 CPU 运行。
- 推荐:12 GB 显存(RTX 4070、RTX 3060 12GB)运行 Q5_K_M,以获得最佳质量与性能比。
仅 CPU 推理:
- 最低:仅 CPU 推理需 16 GB 系统内存。
- 预计只有 GPU 速度的一小部分,这对后台或批处理任务尚可,但对交互式聊天来说较慢。
系统内存:
- Windows 10/11,最低 16 GB 内存(推荐 32 GB)。
基准测试亮点
Phi-4 在 MMLU 上达到 84.8%,在 MATH 上达到 80.4%,在 HumanEval 上达到 82.6%。在 13 项基准测试中,Phi-4 在六项上超越 Llama 3.3 70B(其最新的开放权重竞争对手),在五项上超越 Qwen 2.5。
Phi-4 在 GPQA(研究生水平问答)和 MATH(竞赛级数学题)上超越 Llama 3.3 70B、Qwen 2.5 和 GPT-4o。在 GPQA(研究生水平 STEM 问题)和 MATH(数学竞赛)上,它甚至超过其教师模型 GPT-4o。以 HumanEval 和 HumanEval+ 衡量的编码方面,它的得分也高于任何其他开放权重模型。
Phi-4 的知识截止日期为 2024 年 6 月。该模型的训练数据包含截至该日期的信息。
如何在本地运行
使用 Ollama(推荐--最简单):
打开终端并执行命令 ollama run phi4。此命令执行两个操作:从 Ollama 库下载模型权重,并立即启动交互式聊天会话。
对于 Phi-4-mini,请使用:ollama run phi4-mini
Ollama 在 Windows 上会自动处理 GPU 检测。在 NVIDIA、AMD(ROCm)和 Apple Silicon 上会自动检测 GPU。Ollama 默认为 Q4_K_M。在 8GB GPU 上,它会自动将溢出的层卸载到 CPU 内存。
使用 LM Studio(基于图形界面):
LM Studio 0.4.12 在 Windows 10 和 11 上完全支持 Phi-4 和 Phi-4-mini。它提供聊天界面、模型比较以及带图形界面的本地服务器模式--无需命令行。只需在 Discover 标签页中搜索 "Phi-4",点击下载,然后运行。
其他支持的工具:
借助 Ollama 和 LM Studio 等工具,你可以在消费级硬件上运行 Qwen 3、Gemma 3 和 DeepSeek-R1 等模型--Phi-4 也广泛适用于包括 Jan、GPT4All 和 Msty 在内的其他平台。
最佳使用场景
- 数学与 STEM 推理 - Phi-4 擅长解决数学问题、分析科学概念以及完成多步逻辑证明。
- 代码生成与调试 - 在编码基准测试上的强劲表现使其非常适合软件开发辅助。
- 本地隐私关键型应用 - 完全在自有硬件上离线运行 AI,无需将数据发送到云服务。
- 资源受限环境 - 部署在普通的消费级 GPU(12GB 显存)甚至仅 CPU 系统上。
- 教育与研究工具 - 以高推理质量分析文档、解释概念并生成学习材料。
- 规模化高性价比推理 - 初始硬件投资之后,高用量使用无需按 token 付费。
注意:对于某些任务,Phi-4 仍从根本上受其规模限制,尤其是在事实知识方面的幻觉问题。
常见问题
我可以在具有 8 GB GPU 显存的笔记本电脑上运行 Phi-4 吗?
可以,但需要 CPU 卸载。Phi-4 在 Q4_K_M 下需要约 9 GB--比 RTX 4060 8GB 的极限多出约 1 GB。Ollama 和 llama.cpp 会通过将部分层保留在系统内存中来自动处理溢出。模型可以运行,但比在 12 GB GPU 上慢约 50%。
Phi-4 和 Phi-4-mini 之间有什么区别?
Phi-4 是 140 亿参数,而 Phi-4-mini 是 38 亿参数,针对推理和 128K 上下文任务优化。Phi-4-mini 更高效但略逊一筹,而 Phi-4 以更高的显存需求为代价提供更强的推理能力。
Phi-4 可免费用于商业用途吗?
可以。Phi-4 14B 在 MIT 许可下发布,这是一种宽松的开源许可,允许商业使用、修改和再分发。
Phi-4 与云 API 相比有多快?
在假设量化完全装入显存的情况下,中端 GPU 上估计约为每秒 20 个 token,高端显卡上可达每秒 55 个 token。速度因硬件而异;Ollama 和 LM Studio 会自动处理优化。
来源与版权