设置

语言

AI API 批量推理定价:异步任务如何节省成本

CryptoCrypto
·2026年7月14日·约 7 分钟阅读·更新 2026年7月26日·268 次浏览
#定价#AI API#模型基础设施#TokenLab
AI API 批量推理定价:异步任务如何节省成本

批量推理定价的工作原理是用响应延迟换取更低的每 Token 费率:你提交一个任务,服务商在规定的时间窗口内(通常最长为 24 小时)处理它,而你支付的费用低于同步、实时调用的费用。这种权衡是否值得,完全取决于你的工作负载是否能容忍等待。

本文基于 OpenAI 和 Google 发布的 Batch API 文档,对比了批量(异步)推理与标准同步 API 调用,并为你的产品何时通过异步路径真正节省成本制定了一个决策框架。

关键要点

  • OpenAI 和 Gemini 都发布了 Batch API,接受异步处理任务并提供比同步调用更低的折扣费率;在制定预算前,请务必在各服务商的定价页面确认当前的准确折扣百分比,因为费率可能会发生变化。
  • 批量推理适用于可以容忍周转窗口、不需要立即响应的工作负载:批量分类、Embedding 生成、离线评估、数据集标注和回填任务。
  • 实时聊天、编程助手和交互式产品功能通常不适合批量定价,因为处理窗口使得它们无法用于实时用户交互。
  • 最大的累计节省通常来自将批量折扣与模型选择和 Prompt 优化工作相结合;请参阅 /models/rankings 和 AI API 成本削减指南以了解其他手段。

批量推理的实际含义

同步 API 调用会在模型生成响应后立即返回,通常在几秒钟内完成。你为这种即时性支付每 Token 费率。批量推理则颠倒了模型的使用方式:你不再进行单一的请求-响应交换,而是将文件或请求列表作为任务提交。服务商会将任务排队,在其控制的窗口内进行处理,并在完成后供你检索结果。

这并不是模型内部的一种新的推理技术,而是一种不同的商业和运营契约。服务商可以利用闲置或非高峰容量来安排你的工作负载,作为交换,其每 Token 收费低于必须即时服务的请求。

OpenAI 和 Google 都为其各自的 API 记录了这种模式:

  • OpenAI 的 Batch API 参考文档描述了如何从上传的请求文件中创建批处理对象、跟踪其状态,并在任务完成后检索输出(platform.openai.com/docs/api-reference/batch/object)。
  • Google 的 Gemini Batch API 文档描述了一个类似的模式:提交一批请求,任务异步运行,处理完成后检索结果(ai.google.dev/gemini-api/docs/batch-api)。

各服务商之间的机制略有不同(基于文件的提交、任务对象、状态轮询、输出检索),但底层逻辑是一致的:现在提交,稍后收集,每 Token 支付的费用比同步调用更少。请查看各服务商的最新文档,了解适用于你账户和模型的具体处理窗口和折扣率,因为这些细节是特定于服务商的,且可能会发生变化。

两种已记录的 Batch API 如何工作

从机制层面来看,两家服务商都遵循相似的生命周期:

  1. 准备请求。 你组装想要处理的单个推理请求,通常格式化为一个文件(OpenAI 接受一个由自定义 ID 标记的请求文件;Gemini 接受一批结构化请求)。
  2. 提交任务。 你创建一个引用已上传输入内容的批处理对象或任务资源。
  3. 轮询或等待完成。 任务会经历不同的状态(排队中、处理中、已完成或失败),直到服务商在其记录的窗口内完成处理。
  4. 检索输出。 完成后,你下载或获取输出文件或结果集,通过 ID 将每个响应与原始请求匹配。

两家服务商都不会立即处理批量任务。这就是该定价模式的核心所在:任务按照服务商的时间表运行,而不是按照你的时间表,你接受一定的延迟以换取更低的费率。如果你的产品无法容忍这种延迟,那么无论纸面上能节省多少钱,批量定价都不适合你。

批量定价何时能节省成本:决策清单

在将工作负载路由到批量端点之前,请使用此清单进行评估:

  • 工作负载是否具有天然的非交互性? 对数据集进行分类、为文档语料库生成 Embedding、内容审核扫描或夜间汇总任务都符合条件。
  • 你的产品能否容忍记录的处理窗口? 如果用户或下游系统需要在几秒或几分钟内获得结果,则不适合批量处理。
  • 数据量是否足够大? 批量折扣是按 Token 应用的,因此绝对节省额随数据量增加。少量请求无论如何都不会对你的账单产生显著影响。
  • 任务是否幂等或可安全重试? 由于批量任务异步运行且可能部分失败,你的流水线需要处理重新提交或部分完成的情况,而不会破坏下游状态。
  • 你的编排层是否已经支持异步任务轮询? 如果你是首次构建此模式,请预留工程时间用于任务提交、状态轮询和输出核对。
维度 同步 API 批量(异步)API
延迟 通常为秒级 分钟到小时级,受限于服务商记录的窗口
定价 标准每 Token 费率 相对于同步调用的折扣每 Token 费率(见服务商文档)
最佳适用场景 聊天、智能体、实时产品功能 批量分类、Embedding、离线评估、数据回填
故障处理 调用时立即报错 任务级状态;批次内可能出现部分失败
工程开销 简单的请求-响应 需要任务提交、轮询和输出检索逻辑
输出顺序 与调用顺序匹配 通过自定义请求 ID 匹配,非调用顺序

批量定价不适用的场景

批量推理不适用于任何需要人或下游系统等待响应的场景。这包括:

  • 对话式智能体和聊天产品。 用户期望在几秒钟内得到回复,而不是在处理窗口之后。
  • 编程助手和智能体编程工作流。 基于 Claude Sonnet 5 或 Kimi K2.7 Code 等模型构建的工具依赖于开发者与模型之间的紧密反馈循环;批处理会完全破坏这种交互。
  • 面向用户功能的实时内容生成,包括通过 Nano Banana Pro 或 Veo 3 等 API 进行的按需图像或视频生成,用户正在观看进度指示器。
  • 任何有服务等级延迟要求的功能,即使该要求很宽松(例如,一分钟以内)。批量处理窗口通常以小时而非秒来衡量。

如果你的流水线一部分是实时的,另一部分不是,请将工作拆分。将交互部分通过同步 API 路由,将大批量、可容忍延迟的部分(夜间重新索引、数据集重新标注、评估运行)推送到批量端点。

实用的请求格式

OpenAI 的批处理对象和 Gemini 的 Batch API 之间的具体模式有所不同,因此请将以下内容视为示意性格式,而非任何服务商请求格式的字面复制。在实施之前,请根据当前文档确认具体的字段名称和端点。

# 1. 准备一个请求文件,每个请求都有一个自定义 ID
{"custom_id": "req-001", "method": "POST", "url": "/v1/chat/completions",
 "body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
{"custom_id": "req-002", "method": "POST", "url": "/v1/chat/completions",
 "body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}

# 2. 提交批量任务
POST /v1/batches
{
  "input_file_id": "file-abc123",
  "endpoint": "/v1/chat/completions",
  "completion_window": "24h"
}

# 3. 轮询任务状态
GET /v1/batches/{batch_id}
# 返回状态: queued | in_progress | completed | failed

# 4. 完成后检索输出
GET /v1/files/{output_file_id}/content
# 通过 custom_id 将每个响应与原始请求匹配

无论服务商是谁,核心工程模式都是一样的:使用稳定 ID 构建请求文件,提交任务,轮询完成情况,并将输出与原始请求列表进行核对。围绕任务级别的部分失败构建重试逻辑,因为即使任务本身成功,批次中也可能有个别请求失败。

将批量折扣与模型选择相结合

批量定价只是一种手段。它与 AI 模型路由基准AI API 成本削减指南 中涵盖的模型和 Prompt 级别决策是相辅相成的,而非替代关系。对于既符合批量处理条件又由低成本模型(如 DeepSeek V4 Flash、GLM-5.2 或 Gemini 3.5 Flash 等适合路由的任务模型)处理的工作负载,通常会比单独使用任何一种手段获得更大的绝对节省。在将大型批量任务提交给单一模型和定价层级之前,请在 /models/rankings 查看当前的各模型定价和定位,因为随着服务商更新其产品线,前沿模型与低成本模型之间的相对价格会发生变化。

对于评估是否需要构建批量支持的团队来说,计算很简单:估算你每月可容忍延迟任务的 Token 总量,将记录的批量折扣与你目前在该总量上的同步支出进行比较,并将其与构建任务提交和轮询逻辑的工程成本进行权衡。如果数据量很小,折扣可能无法抵消增加的复杂性。

局限性

本比较基于 OpenAI 和 Google 在 2026-07-14 观察到的 Batch API 通用机制。确切的折扣百分比、处理窗口长度、各模型的可用性以及文件格式要求均由服务商决定,会随时间变化,此处不再作为固定数字重述。在制定预算或进行开发前,请直接根据各服务商的文档核实当前的批量定价和条款。本文也不涵盖所有模型服务商的批量支持情况;在规划之前,请先检查你选择的模型和供应商是否发布了批量端点。

常见问题解答

批量推理比同步调用便宜多少? OpenAI 和 Google 都记录了相对于其标准同步费率的批量处理折扣,但确切百分比取决于服务商和时间。在估算节省额之前,请查看你所用服务商和模型的当前定价页面。

如果我的批量任务没有在处理窗口内完成会怎样? 服务商文档描述了任务状态(如排队中、处理中、已完成和失败)。请查阅各服务商关于如何处理超出完成窗口任务的文档,因为行为可能因服务商而异,且可能会发生变化。

我可以使用批量推理进行实时聊天功能吗? 不能。批量任务在几分钟到数小时的处理窗口内异步处理,这使得它们不适合任何用户或系统正在等待立即响应的工作负载。请将同步 API 用于交互式功能,并将批量端点保留用于可容忍延迟的高容量任务。

如果你正在评估批量定价是否适合你的工作负载,请比较当前的各模型费率和排名,然后在投入工程时间进行任务提交和轮询逻辑开发之前,对照上述清单映射你的可容忍延迟任务。

来源

价格观测于 2026-07-14

分享:

相关模型

公开模型最近更新

用本文涉及的模型开始构建

对比价格、测试路由,把文章里的调研直接变成可运行的 API 调用。