编码工具
控制 Coding Agent 费用
用真实用量减少花费,不必让所有任务都换成弱模型
Coding Agent 会反复发送指令、对话历史、代码和工具结果。会话越长,费用越容易累积。真正值得调整的是模型、上下文、输出长度,以及模型明确支持时的缓存。
从自己的用量开始
在 API 密钥所属工作区打开用量,按模型或密钥查看请求。不要套用通用的“每小时成本”,而要比较相近任务的实际费用。
至少关注:
- 输入、输出和缓存 Token
- 每个完成任务的总费用
- 失败和重复请求
- 使用的模型与 API 密钥
让模型匹配任务
不是每一步都需要最贵的模型。
| 任务 | 更值得关注什么 |
|---|---|
| 架构设计或困难排错 | 推理质量与足够的上下文 |
| 小范围修改和常规审查 | 更低价格下的指令遵循能力 |
| 搜索、分类和样板代码 | 速度与输入价格 |
| 最终检查 | 在精简上下文中的输出质量 |
当前价格和能力以模型页为准。准备更换模型时,用同一组代表性任务比较,结果会比榜单或通用推荐更可靠。
只带需要的上下文
- 默认只提供当前任务需要的文件和日志,不要每次都塞进整个仓库。
- 旧对话已经没有帮助时,新开一个会话。
- 让 Agent 自己搜索代码,避免反复粘贴大段目录内容。
- 精简可复用指令,删掉重复规则。
限制无用的长输出
任务的回答长度可预期时,设置所选 API 格式支持的输出上限。Chat Completions、Messages 和 Responses 的字段不同,请使用对应端点公开说明的字段。
这个上限可以避免意外的超长输出,但要给任务留下足够的完成空间。
模型明确支持时再算缓存收益
部分模型会对缓存输入收取更低费用。是否支持、如何计价,都以模型价格详情为准;实际有没有命中缓存,可以在响应或用量中确认。
用 API 密钥分开项目
需要分别限制额度或查看用量时,为不同项目和编程工具创建不同的 API 密钥。单独设置密钥限额,也能避免一个工具耗尽全部余额。
用真实任务比较
- 选一小组能代表日常工作的任务。
- 保持上下文一致,分别使用候选模型完成。
- 结合实际结果和用量记录,比较完成质量、重试次数、总 Token 和最终费用。
每 Token 最便宜,不一定代表完成任务最省。便宜模型如果需要多次重试,总费用可能更高。