OpenRouter 发布 Batch API:批量推理成本减半,90% 请求 1 小时内完成
更新背景
随着大模型应用的深入,企业级用户和开发者面临着日益增长的异步数据处理需求,如大规模数据标注、Embedding 回补、评测集打分以及海量工单摘要等。传统的同步 API 模式要求即时响应,不仅成本高昂,且难以应对突发的流量高峰。OpenRouter 此次推出的 Batch API 正是为了解决这一痛点,通过引入异步批量处理机制,让开发者能够以更低成本、更高效率完成大规模推理任务。
核心突破与功能特性
1. 成本优化:高达 50% 的折扣
Batch API 的核心价值在于显著降低推理成本。当用户提交一个批量请求时,模型提供商有权在 24 小时的时间窗口内选择最佳时机完成计算。作为交换,提供商通常会收取标准按 Token 计费价格的 50%(部分情况下甚至更低)。这种机制特别适用于那些对响应时间容忍度较高,但需要处理海量数据的场景。
2. 极速交付:实测表现优异
在为期两周的 Beta 测试期间,OpenRouter 处理了超过 230,000 个 批量请求。数据显示,绝大多数任务完成速度远超预期:
- 中位完成时间:仅 7 分钟。
- 90% 的请求:在 1 小时内 完成。
- 99% 的请求:在 10.3 小时 内完成。
值得注意的是,提交时间对完成速度的影响远大于请求数量。在太平洋时间 5 点至中午期间提交的批次较慢,而下午 6 点后提交的任务,90% 的请求可在 50 分钟内完成。
3. 全面兼容与灵活调度
- 多模态支持:支持 Chat Completions、Responses、Messages 以及 Embeddings 等多种请求形状。任何已发送给 OpenRouter 的请求体格式均可直接使用。
- BYOK 支持:若配置了提供商密钥(Provider Key),批量请求将直接路由至该密钥,仅支付 BYOK 费用。
- 容错机制:每个请求的结果独立返回,即使部分行失败,也不会影响整个批次的其他任务。
- 数据保留:输入与结果数据保留 30 天,或直至用户手动删除。
实际应用价值
对于开发者而言,Batch API 极大地简化了大规模数据处理的工作流。例如,在需要为数千行数据生成摘要或进行模型评估时,开发者只需一次性提交所有请求,无需编写复杂的并发循环代码。系统会自动处理排队、调度与结果聚合,开发者只需通过轮询 GET /api/v1/batches/:id 接口监控状态即可。此外,所有操作均记录在日志系统的 Batches 标签页中,便于成本追踪与审计。
技术架构解读
Batch API 本质上是一个异步 API,它改变了传统请求的即时性约束。通过引入“接受延迟”的商业模式,OpenRouter 与模型提供商共同优化了资源利用率。虽然大批次(如 1000+ 请求)的处理时间会延长至 12-21 分钟,但对于大多数非实时任务来说,这一延迟完全可接受,且换取了显著的成本节约。
“我们观察到,在 Beta 测试期间,绝大多数批次在几分钟内就完成了,这证明了该架构在处理高并发异步负载时的成熟度。” —— OpenRouter 团队
如何开始使用
开发者只需选择一个支持批量的模型,获取 API 密钥,即可通过 POST /api/v1/batches 接口提交第一批任务。详细的请求与响应格式请参考官方文档中的 Quickstart 部分。