因为模型字符串变动而遇到 404 错误,这对于开启 Agent 循环来说是一个糟糕的开始。Gemini 3.5 Flash API 非常值得接入到快速 Agent 循环中,但前提是你必须先根据实时模型列表确认准确的 gemini-3.5-flash 模型 ID。Google Cloud 在标准全球层级(Global tier)上列出的 Gemini 3.5 Flash 价格为每 100 万输入 token 1.50 美元,每 100 万文本输出 token 9.00 美元;Flex/Batch 定价为输入 0.75 美元,输出 4.50 美元。我们在源码中看到了同样的陷阱:今天能用的模型 ID 明天可能会抛出 404 错误。网上的价格表经常将已确认的供应商定价与未经交叉核对的目录列表混在一起。本指南将涵盖当前可验证的内容、不可验证的内容,以及如何构建一个在模型 ID 变更时不会崩溃的 Agent 循环。
关键要点
- Google Cloud 的 Agent Platform 定价页面列出 Gemini 3.5 Flash 在标准全球层级上的价格为每百万输入 token 1.50 美元,每百万输出 token 9.00 美元,这与 TokenLab 目录在刷新时的列表一致。
- 需要锁定的确切模型字符串是
gemini-3.5-flash;Google 的 Gemini API 模型页面将其列为稳定模型的示例。但在部署前,仍需通过实时模型列表进行确认。 - 通过 TokenLab 的统一 API 进行路由意味着你无需硬编码特定于供应商的 SDK 字符串;TokenLab 会将稳定的模型别名(slug)映射到当前有效的底层标识符。
- 下表中竞争对手的价格(GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash)仅来自 TokenLab 的目录。本次审查中未提供这些模型的独立供应商定价页面——在根据这些价格进行预算前,请直接与 OpenAI、Anthropic 和 DeepSeek 核实。
- 此处未引用基准延迟数据(首字延迟、完整的 5 步循环持续时间),因为没有独立来源。请自行对循环进行检测,并测量每一步的 p50/p95,而不是引用二手数据。
- 在 Agent 循环中,输出 token 通常占据支出的大头——Gemini 3.5 Flash 的输出费率(9.00 美元/百万)是其输入费率(1.50 美元/百万)的 6 倍,因此限制
max_output_tokens比缩减提示词长度更重要。
来源快照
| 来源 | 涵盖内容 | 观察日期 |
|---|---|---|
| Google Cloud Agent Platform 定价 | Gemini 3.5 Flash 标准、缓存输入和 Flex/Batch token 定价 | 2026-07-08 |
| Google Gemini API 模型页面 | 稳定模型命名指南;gemini-3.5-flash 被列为稳定模型示例 |
2026-07-08 |
| TokenLab 模型与定价目录 | Google、Anthropic、OpenAI 和 DeepSeek 旗下 gemini-3.5-flash 及竞争对手模型的每 token 定价 |
2026-07-08 |
Google Cloud 的 Gemini Enterprise Agent Platform 将 Gemini 3.5 Flash 列在自己的定价表中,与 Gemini Developer API 定价页面分开。标准全球费率为每百万输入 token 1.50 美元,每百万文本输出 token 9.00 美元。Flex/Batch 全球费率降至输入 0.75 美元,输出 4.50 美元。标准层级的缓存输入价格为每百万 token 0.15 美元。这直接证明了 Gemini 3.5 Flash 是一个稳定、普遍可用的模型,专为 Google Cloud 上的企业级 Agent 工作负载定价,而非占位符或预览标签。读者在对比不同文章的成本时,应在将数字视为可互换之前,检查费率是从哪个定价页面获取的。
Gemini 3.5 Flash API 的模型与成本对比
下表中的所有数字均为 TokenLab 目录列表。标记为“与供应商核实”的行未提供本次审查的独立引用。
| 模型 | 供应商 | 上下文窗口 | 输入 $/M tokens | 输出 $/M tokens | 备注 |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1,048,576 | $1.50 | $9.00 | TokenLab 目录;请与 Google 实时定价页面核实 | |
| gemini-3.1-flash-lite | n/a | $0.25 | $1.50 | TokenLab 目录 | |
| gemini-3-pro-image | n/a | $2.00 | $12.00 | TokenLab 目录,图像层级;请勿用作文本 Agent 替代品 | |
| gpt-5 | OpenAI | n/a | $1.25 | $10.00 | TokenLab 目录 |
| gpt-5.5 | OpenAI | 1,050,000 | $5.00 | $30.00 | TokenLab 目录 - 请与 OpenAI 核实 |
| claude-sonnet-5 | Anthropic | 1,000,000 | $2.00 | $10.00 | TokenLab 目录 - 请与 Anthropic 核实 |
| claude-haiku-4-5 | Anthropic | n/a | $1.00 | $5.00 | TokenLab 目录 |
| deepseek-v4-flash | DeepSeek | 1,048,576 | $0.09 | $0.18 | TokenLab 目录 - 请与 DeepSeek 核实 |
对于进行多次小型工具调用轮次的 Agent 循环,每 token 的最低费率并不总是意味着每任务的最低成本——一个需要更少重试或更短推理轨迹的模型,其表现可能优于标价更低的模型。请测量每个已完成任务的成本,而不仅仅是每个 token 的成本。
Gemini 3.5 Flash API 的实施步骤
在编写代码前确认模型 ID。在刷新时,需要锁定的模型 ID 是
gemini-3.5-flash,Google 的模型文档将其列为稳定模型示例。但在部署前,仍需调用供应商的模型列表端点或查看 TokenLab 的目录。这是解决“SDK 抛出错误”问题的办法:调用时该字符串不存在。任何重试逻辑都无法修复错误的标识符。例如,源码直接描述了那种故障模式。通过统一端点进行路由,而不是使用原始供应商 SDK。使用 TokenLab(或类似的网关)意味着你的应用程序代码引用的是一个稳定的别名,而网关会将其解析为供应商当前有效的标识符。这使你的 Agent 循环与供应商侧的模型重命名或弃用解耦。
构建带有明确步骤和检测功能的循环:
# 仅为说明性结构 - 在部署前根据你网关当前的文档确认确切的端点/模型字段。
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
在我们的流水线中,我们记录每次运行的 timings,并计算代表性任务批次的 p50/p95。不要发布或依赖从他人环境中获取的固定“每循环 N 秒”数字——网络状况、提示词长度和供应商负载都会改变这些数字。
刻意限制输出 token。根据上述目录定价,
gemini-3.5-flash的输出 token 成本约为输入 token 的 6 倍。我们测试了定价数学。为每一步设置max_output_tokens,而不是让模型长时间运行。这在合成步骤中尤为重要,因为该步骤通常会产生冗长的回答。添加回退链。配置一个辅助模型(例如,出于成本考虑使用
gemini-3.1-flash-lite,或者完全使用不同的供应商),这样单一模型的停机或弃用就不会导致整个 Agent 崩溃。
何时使用 TokenLab
- 你需要一个稳定的模型别名,而不是脆弱的供应商字符串。TokenLab 的目录方法意味着你的代码不需要在供应商重命名或弃用模型时进行重写。Google 自身 Veo 3.0 的关闭时间定于 2026 年 6 月 30 日,这显示了其中的风险。
- 在决定供应商之前,你需要一个地方来对比各供应商的成本,而不是每次评估模型切换时都手动检查四个不同的定价页面。
- 你正在运行多供应商回退逻辑,并希望在 Google、Anthropic、OpenAI 和 DeepSeek 模型之间保持一致的请求/响应格式,而不是维护四个独立的 SDK 集成。
相关阅读
常见问题解答
gemini-3.5-flash 是我可以直接调用 Google SDK 的有效模型 ID 吗?
不要想当然。在部署前根据 Google 当前的模型列表进行确认——模型 ID 字符串会发生变化,预览/GA 状态也会随时间推移而改变。如果你通过 TokenLab 进行路由,网关会为你处理这种映射。
对比表中的竞争对手价格来自哪里?
它们是 TokenLab 的目录列表。本文中只有 Veo 视频定价追溯到了独立注明日期的 Google 来源(观察于 2026-07-08)。GPT-5.5、Claude Sonnet 5 和 DeepSeek V4 Flash 的定价未提供独立引用——在将这些数字用于面向客户的成本估算之前,请与各供应商核实。
5 步 Gemini 3.5 Flash Agent 循环有多快?
此处未包含基准数据,因为本文没有独立来源。请检测你自己的循环(见上面的代码示例),并在你的环境中测量实际的 p50/p95 延迟,而不是依赖二手数据。
如果我使用的模型在项目进行到一半时被弃用了怎么办?
这正是 Google Veo 3.0 关闭(2026 年 6 月 30 日)所说明的情况。构建一个回退链,并尽可能通过维护更新模型别名的网关进行路由,这样弃用就不会导致代码重写。
创建 TokenLab API 密钥,以便在部署前对比当前模型 ID。
来源
价格更新于 2026-07-08
- Google AI Gemini API pricing资料更新于 2026-07-08
- Google Cloud Agent Platform pricing资料更新于 2026-07-08
- Google Gemini API models资料更新于 2026-07-08
- TokenLab model directory资料更新于 2026-07-07



