在我们的智能体(Agent)流水线中,单 Token 成本最低的模型往往并非完成任务的总成本最低的模型。当我们测试适用于智能体的最佳廉价 AI 模型时,工具调用、JSON 修复和思维链(chain-of-thought)草稿产生的输出 Token 占据了支出的绝大部分。DeepSeek V4 Flash、Gemini 3.5 Flash、Claude Sonnet 5、GPT-5.5、GLM-5.2 和 Laguna XS 2.1 是我们目前可以讨论的单一事实来源(SSOT)示例。下方的 TokenLab 目录价格观察于 2026 年 9 月 19 日;外部价格未注明日期,需经服务商确认。我们未发布延迟基准测试,因为在刷新时无法获得这些确切路由的受控 TTFT、Token/秒或重试率数据集。请将此视为一份成本与故障模式的候选名单,并在您自己的循环中对延迟进行基准测试。
关键要点
- 输出成本对智能体支出的影响大于输入成本。智能体通过工具调用、重试和 JSON 生成的 Token 远多于其每轮消耗的 Token。
- 在当前具有 TokenLab 目录价格的 SSOT 示例中,DeepSeek V4 Flash 是我们在此处可验证的输出成本最低的选项,价格为每百万 Token(MTok)输入 $0.147 / 输出 $0.294。
- 模型名称冲突是真实存在的。DeepSeek V4 Flash 在两个价格点上出现:TokenLab 目录中的 $0.147/$0.294 和外部列表中的 $0.09/$0.18。
- 视频和图像生成定价(PixVerse、fal、Black Forest Labs)不能作为 LLM Token 定价的证据。它绝不应作为文本智能体成本的引用,我们在下方将其分开了。
- Claude Sonnet 5、GLM-5.2、Kimi K2.7 Code、Qwen3.7 Plus 等模型的外部比较价格缺乏注明日期的公共来源 URL。在制定预算前,请务必在各服务商的定价页面进行核实。
- 单 Token 最便宜并不自动等于单任务最便宜。如果模型在工具调用中失败或截断 JSON,将迫使系统重试,从而抵消节省的成本。
来源快照与故障模式
| 来源 | 内容类型 | 观察日期 | 与本文的相关性 |
|---|---|---|---|
| PixVerse 平台文档 (docs.platform.pixverse.ai) | 视频生成定价 | 2026-07-08 | 不用于 LLM 声明 - 仅限视频,包含在内仅为透明起见 |
| fal PixVerse V6 模型页面 (fal.ai/pixverse-v6) | 视频生成定价 | 2026-07-08 | 不用于 LLM 声明 - 仅限视频 |
| Black Forest Labs 定价文档 (docs.bfl.ml) | 图像生成定价 | 2026-07-08 | 不用于 LLM 声明 - 仅限图像 |
| TokenLab 内部模型目录 | 第一方 LLM 及媒体定价 | 2026-09-19 | 下方所有 TokenLab 目录价格的主要来源 |
| 各服务商定价页面 (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) | LLM 定价 | 本数据集中未注明日期 | 在进行公开预算声明前必须独立核实 |
PixVerse、fal 和 BFL 来源出现在我们的研究集中,是因为我们在更广泛的媒体定价扫描中获取了它们。它们描述的是按秒计费的视频和按图像计费的积分成本,与按 Token 计费的 LLM 定价无关。我们在此列出它们是为了让读者了解我们排除它们的原因。我们不会将它们用于 LLM 相关的声明。
在我们的流水线中,我们会记录工具调用重试率、JSON 截断、错失的工具调用以及幻觉函数参数,并将其与 Token 支出一并记录。在刷新时,我们没有针对这些确切路由的受控重试率数据集,因此无法发布具体比率。例如,一个 $0.05/MTok 的模型如果工具调用失败率为 15%,其重试成本可能比失败率为 2% 的 $1/MTok 模型更高。这种故障模式的数学计算(而非标价)才应决定您对廉价层级的选择。
最佳廉价 AI 智能体模型的模型与成本比较
以下所有价格均为 TokenLab 自身的第一方目录列表(按 Token,以 $/MTok 表示),观察于 2026 年 9 月 19 日。它们是本文中 LLM 智能体成本声明的正确依据。
| 模型 | 服务商 | 输入 $/MTok | 输出 $/MTok | 智能体适用性 |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.147 | $0.294 | TokenLab 目录中当前输出密集型任务的最廉价 SSOT 选项;比较外部报价前请确认确切模型 ID |
| Gemini 3.5 Flash | $1.50 | $9.00 | 多模态智能体步骤(图像 + 文本工具使用) | |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 预留用于智能体输出的最终验证/QA 环节 |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 复杂规划或模糊工具选择的备选方案 |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 旗舰级对比;在智能体循环内很少有必要使用 |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 高端上限 |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | 低成本路由的开放权重示例 |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | 编码智能体示例 |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | 低成本路由示例 |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | 低成本路由示例 |
| DeepSeek V4 Pro | DeepSeek | $0.441 | $0.882 | 同一系列内更繁重的推理子任务 |
我们保留下方的外部数据以保持审计连续性,并标记每一行均为“未验证”。请勿将其用于预算编制。确切细节必须根据当前文档进行确认。
| 模型 | 服务商 | 输入 $/MTok | 输出 $/MTok | 验证状态 |
|---|---|---|---|---|
| DeepSeek V4 Flash (外部列表) | DeepSeek | $0.09 | $0.18 | 与上方 TokenLab 目录不同 - 确认此价格指代的产品/层级;我们的来源集中无注明日期的 URL |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| GPT-5.5 Batch/Flex | OpenAI | $2.50 | $15.00 | 我们的来源集中无注明日期的 URL;非标准 GPT-5.5 行 |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 我们的来源集中无注明日期的 URL;请对照服务商文档确认 |
已退役的目录价格点不再对应当前的 SSOT 模型名称。我们保留这些数字以保持审计连续性,但在没有服务商确认的情况下,我们不会将新的智能体工作路由到这些未命名的层级。
| 已退役或非 SSOT 层级 | 输入 $/MTok | 输出 $/MTok | 状态 |
|---|---|---|---|
| 已退役超低成本层级 | $0.05 | $0.40 | 不再是当前的 SSOT 示例;使用前请确认继任者 |
| 已退役低成本 flash-lite 层级 | $0.25 | $1.50 | 不再是当前的 SSOT 示例;映射至 Gemini 3.5 Flash 或 DeepSeek V4 Flash 并确认 |
| 已退役低成本 mini 层级 | $0.25 | $2.00 | 不再是当前的 SSOT 示例;映射至 Claude Sonnet 5 或 DeepSeek V4 Flash 并确认 |
| 已退役小型验证层级 | $1.00 | $5.00 | 不再是当前的 SSOT 示例;映射至 Claude Sonnet 5 并确认 |
| 已退役中层备选层级 | $1.25 | $10.00 | 不再是当前的 SSOT 示例;映射至 GPT-5.5 并确认 |
| 已退役高端上限 | $15.00 | $120.00 | 不再是当前的 SSOT 示例;映射至 GPT-5.5 或 Claude Fable 5 并确认 |
最佳廉价 AI 智能体模型的实施说明
- 按任务对智能体进行分层,而不是仅使用单一的最廉价模型。将路由、分类和工具选择任务分配给 DeepSeek V4 Flash 或 Gemini 3.5 Flash。将多步规划升级到 DeepSeek V4 Pro 或 GPT-5.5。预留 Claude Sonnet 5 用于最终答案的验证。
- 在廉价层级激进地限制输出 Token。由于输出成本在智能体支出中占主导地位,请对 DeepSeek V4 Flash 和 Gemini 3.5 Flash 调用设置严格的最大 Token 限制。仅允许在升级层级进行更长的生成。
- 记录每个模型的故障模式,而不仅仅是每次调用的成本。将 JSON 截断、错失的工具调用和幻觉函数参数与 Token 支出分开追踪。例如,一个 $0.05/MTok 的模型如果工具调用失败率为 15%,其重试成本可能比失败率为 2% 的 $1/MTok 模型更高。
- 在代码中固定确切的模型 ID,绝不要使用别名。鉴于上述名称冲突(两个不同的 DeepSeek V4 Flash 价格点),请硬编码完整的供应商和模型字符串。在每次服务商更新时重新核实定价。
- 每季度重新检查外部定价。本文中任何没有注明日期的来源 URL 的内容,在出现在面向客户的成本估算之前,都应从服务商的实时定价页面重新获取。
以下是一个使用本文中目录模型名称的路由草图。确切的 TokenLab 请求格式和工具调用错误字段必须在生产使用前在 TokenLab API 文档中确认。
路由草图,非 TokenLab API 合约。请在 TokenLab API 文档中确认请求格式。
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
如果工具调用缺失或 JSON 被截断,则重试一次
如果响应包含有效的工具调用和有效的 JSON:
返回响应
记录该模型的故障模式
如果最终层级失败,则引发错误
此草图展示了重试边界:捕获工具调用错误,记录故障模式,然后移动到下一个模型。在生产前,请在当前的 TokenLab API 文档中确认请求格式和错误字段。
TokenLab 如何适配智能体路由
- 单一目录减少了各供应商账户管理的繁琐。TokenLab 在一个 API 和计费界面下公开了 OpenAI、Google、Anthropic 和 DeepSeek 的定价层级。将工作流步骤从 DeepSeek V4 Flash 切换到 Gemini 3.5 Flash 仅需更改配置,无需进行新的集成。
- 可审计的第一方、带日期定价。与分散的第三方报价不同,本文中的 TokenLab 目录数字是从平台自身在 2026 年 9 月 19 日观察到的列表中提取的。这就是为什么它们是此处唯一无需“必须核实”警告即可呈现的价格。
- 内置智能体流水线分层。由于 TokenLab 同时托管廉价层级和升级层级模型,您可以跨 DeepSeek V4 Flash、Gemini 3.5 Flash 和 Claude Sonnet 5 进行 A/B 测试成本和故障率。您无需重新架构智能体的路由逻辑。
相关阅读
常见问题解答
为什么我看到 DeepSeek V4 Flash 有两个价格?
DeepSeek V4 Flash 在我们的来源集中以两个价格点出现:TokenLab 目录中的 $0.147/$0.294 和外部列表中的 $0.09/$0.18。模型名称在各供应商和经销商之间会被重复使用并重新定价。请在代码中固定确切的供应商和模型 ID,然后对照服务商的实时文档进行核实,而不是仅凭名称信任。
我可以使用外部参考价格进行预算编制吗?
暂时不行。这些行在我们的来源集中缺乏注明日期的来源 URL,因此我们将其标记为需要服务商确认。TokenLab 目录数据是规划基础,外部表格仅作为您自行核实的起点,而非最终数字。确切细节必须根据当前文档进行确认。
哪种当前的 SSOT 模型对于生产环境的智能体最便宜?
在具有 TokenLab 目录价格的当前 SSOT 示例中,按输出成本计算,DeepSeek V4 Flash 是我们在此处可验证的最低价格,为 $0.294/MTok 输出。外部列表显示为 $0.18/MTok 输出,但该数字需要服务商确认。在考虑特定工具调用模式下的重试率后,再衡量哪种最便宜。
如果本文是关于 LLM 定价的,为什么引用 PixVerse、fal 和 BFL?
它们并未被引用作为任何 LLM 价格声明的证据。它们仅出现在“来源快照”表格中,旨在说明我们更广泛的研究扫描的透明度,并明确标记为不用于 LLM 声明。“模型与成本比较”表格中的每一个美元数字均来自 TokenLab 自身的目录,或被标记为未验证。
工具调用重试如何改变最廉价模型的选择?
一个廉价模型如果工具调用失败或截断 JSON,会迫使系统重试,而这些重试会增加输出 Token。例如,一个 $0.05/MTok 的模型如果工具调用失败率为 15%,其重试成本可能比失败率为 2% 的 $1/MTok 模型更高。在我们的流水线中,我们记录每个模型的重试率并比较完成任务的成本,而不是单 Token 成本。
探索 TokenLab 模型目录并立即开始比较成本:TokenLab 模型目录。
来源
价格更新于 2026-07-07
- PixVerse Platform Docs资料更新于 2026-07-08
- fal PixVerse V6 model page资料更新于 2026-07-08
- Black Forest Labs pricing docs资料更新于 2026-07-08
- fal FLUX.2 model page资料更新于 2026-07-08
- Google AI Gemini API pricing资料更新于 2026-07-08
- Claude Platform pricing资料更新于 2026-07-08
- OpenAI API pricing资料更新于 2026-07-08
- DeepSeek API pricing资料更新于 2026-07-08



