技巧 · Anthropic Official Blog & Claude Platform Documentation
利用批量处理将Claude API成本降低50%,适用于大规模文档分析
图片: kenny cheng 来自 Unsplash
Claude Message Batches API允许您以异步方式提交多达10000个请求,价格仅为实时调用的一半——非常适合处理大型文档集、对工单进行分类或过夜扩充数据集。无需为单个API请求支付全价,批量处理可将成本降低50%,且大多数批次在1小时内即可完成,让您的团队无需复杂的基础设施即可处理大规模工作流。
Claude Message Batches API专为处理大量非时效性数据的专业团队而设计。无需像单个API调用那样各自消耗完整的计算资源,批量处理将数百或数千个请求聚合在一起,让Anthropic的基础设施能够针对整个请求组优化资源配置。结果就是:每个请求的成本降低50%。
以下是实际运作方式。假设您管理客户支持工单——每天约有5000条工单需要情感分类和类别标记。使用同步API,您需要逐条发送每个工单,按全价支付(每百万输入token3美元),并且会受到速率限制。而使用Batches API,您可以将全部5000个工单一次性放入JSONL文件中提交,为每个请求分配唯一的custom_id,让Anthropic在接下来的1至24小时内处理,费用仅为每百万输入token1.50美元。大多数批次在1小时内完成;所有批次均在24小时内完成。随后您可以下载JSONL格式的结果,通过custom_id将输出与工单进行匹配。
对于数据扩充管道,节省的成本会不断累加。一个典型的每月处理500000条记录的工作流,使用批量处理而非同步调用,每月可节省超过1000美元。如果再结合提示词缓存(Prompt Caching,可将系统提示词存储在服务器端,已缓存token费用降低90%),在某些工作负载下总节省可达95%。
设置过程非常简单:将请求格式化为JSONL文件,每个请求分配唯一的custom_id,POST到batches端点,轮询等待完成,然后检索结果。每个请求可以独立失败——批次对象中的request_counts字段会实时跟踪成功、出错、已取消和处理中的数量。对于已在生产环境中运行Claude的团队而言,将非紧急任务切换到批量处理是2026年投资回报率最高的优化方案之一。