每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Anthropic: Claude Haiku 4.5

快速型 Claude,适合轻量智能体、办公任务与即时响应对话
对比模型
claude-haiku-4-5
可用Anthropic聊天缓存输入便宜 90%
输入 / 输出-70%
$1.00 / $5.00$0.30 / $1.50
上下文
200K
最大输出
64K
模态
视觉聊天
能力
工具调用提示词缓存推理

Claude Haiku 4.5 简介

Claude Haiku 4.5 是 Anthropic 的小型快速 Claude 模型,2025 年 10 月发布,面向大批量和对延迟敏感的任务。Anthropic 称它是产品线中最快的模型,智能水平接近前沿。它接受文本和图像,支持工具调用和提示词缓存,扩展思考需要手动设置 token 预算,不像较新的 Claude 模型那样使用自适应思考。

擅长的任务

  • 在 Anthropic 概览页列出的 Claude 模型中延迟最低,适合聊天前端和实时助手。
  • 能同时读图和文本,可以批量分类截图、收据和图表。
  • 扩展思考是可选的,用明确的 token 预算设置,每个请求都可以决定为推理付出多少。
  • 支持工具调用、结构化 JSON 输出和提示词缓存,在智能体循环中重复使用的系统提示词成本很低。

什么情况换别的模型

  • 知识截止日期比 Claude 5 代早得多,对近期的库和事件了解较少。
  • 上下文窗口和输出上限比 Opus 和 Sonnet 5.x 模型小,限制了整个仓库或整本书级别的任务。
  • 长时间自主编程或含糊的多步规划,用 Sonnet 或 Opus 模型出错更少。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Messages API
    POST/v1/messages
    API 格式:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-4-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

价格

TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

默认规格

每 1M token
官方价格
输入 $1.00 / 输出 $5.00 / 缓存读取 $0.10 / 缓存写入 $1.25
TokenLab 价格
输入 $0.30 / 输出 $1.50 / 缓存读取 $0.03 / 缓存写入 $0.375
折扣
-70%
提示词缓存价格

缓存读取

官方价格
$0.10
TokenLab 价格
$0.03
折扣
-70%

缓存写入

官方价格
$1.25
TokenLab 价格
$0.375
折扣
-70%
工具附加费

按次计费,仅在模型实际使用工具时收取。

网页搜索

官方价格
$0.01/次搜索
TokenLab 价格
$0.003/次搜索
折扣
-70%

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
30 天成功率
100.0%
7 天中位延迟
1 sn=269
7 天 P95 延迟
16.1 sn=269
30 天请求数
100+
最后活动时间
3分钟前

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Claude Haiku 4.5 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 claude-haiku-4-5 发一条简短消息,接口是 /v1/messages。返回回复,附上延迟和费用。

使用场景

适用场景
  • 推理
  • 视觉
  • 实时对话与客服

    放在面向客户的聊天窗口后面,回复速度比深度更重要,用工具调用查订单,问题变难时转人工。

  • 分类与信息提取

    给工单打标签,从发票或截图里提取字段,为每天运行数千次的下游流程返回严格的 JSON。

  • 子智能体工人

    在多智能体架构里当低成本的工人:大模型负责规划,多个 Haiku 调用并行搜索、总结或检查文件。

提示词示例

把这封客服邮件分类为账单、故障、功能需求或其他,返回包含标签和一句话理由的 JSON。

用三个要点总结这段聊天记录,并列出每个待办事项及其负责人。

看看这张报错弹窗的截图,告诉我用户应该修改哪个设置。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Claude Haiku 4.5 最适合做什么?

快速、大批量的任务:聊天助手、分类、数据提取、摘要和工人智能体。Anthropic 把它定位为智能水平接近前沿的最快 Claude 模型,响应时间和吞吐量比最深的推理更重要时,默认选它。

Claude Haiku 4.5 支持扩展思考吗?

支持,但是手动形式:开启思考并设置 token 预算。它不使用较新的 Sonnet 和 Opus 模型的自适应思考模式或 effort 参数,推理深度由你传入的预算控制。

Claude Haiku 4.5 能处理图像吗?

能。它接受图像和文本一起输入,输出文本,可以读取截图、图表和扫描文档。它不能生成或编辑图像,需要图片输出时请用图像模型。

什么时候该从 Haiku 4.5 升级到 Sonnet?

当 Haiku 在长提示词里漏掉指令、在多工具智能体运行中丢步骤,或者需要了解近期发布的内容时。下一档是 Sonnet 5.5,它保持了较快的速度,上下文窗口更长,知识截止日期也晚得多。

Claude Haiku 4.5 的费用是多少?

在 TokenLab 上,Claude Haiku 4.5 的价格为 输入 $0.30 / 输出 $1.50 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Claude Haiku 4.5 的上下文窗口和输出上限是多少?

Claude Haiku 4.5 最多接收 200,000 token 的上下文,单次最多返回 64,000 token。

Claude Haiku 4.5 应该使用哪个端点?

Claude Haiku 4.5 使用 https://api.tokenlab.sh/v1/messages。代码写法见下方的请求示例。

Claude Haiku 4.5 支持哪些操作?

Claude Haiku 4.5 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Claude Haiku 4.5 对比

用到 Claude Haiku 4.5 的指南

资料来源

审阅于 2026年10月2日

更多 Claude 4 模型

相关模型