每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Anthropic: Claude Haiku 5.5

速度最快的 Claude 模型,面向高并发、低延迟场景,适合分类、信息抽取、路由和子代理任务。
对比模型
claude-haiku-5-5
可用Anthropic聊天缓存输入便宜 90%新发布
输入 / 输出-70%
$0.10 / $0.50$0.03 / $0.15
上下文
1M
发布日期
2026年10月7日
最大输出
128K
模态
视觉聊天
能力
工具调用提示词缓存推理

Claude Haiku 5.5 简介

Claude Haiku 5.5 是 Anthropic 的小型快速 Claude 模型,2026 年 10 月 7 日发布,面向高并发、对延迟敏感的工作,如分类、信息抽取、路由和子代理任务。它是第一个带可调 effort 的 Haiku,同一个模型既能快速处理简单请求,也能在难题上多想一会儿。Anthropic 称它是标准速度下最快的模型,知识截止日期为 2026 年 6 月。

擅长的任务

  • Anthropic 称它是标准速度下最快的模型,适合实时客服和浏览器操作。
  • 它是第一个带 effort 等级的 Haiku,同一个模型可以处理快速对话,也能处理更长的智能体任务。
  • Anthropic 称它在 OSWorld 2.1、GDPval-AA 和 Terminal-Bench 4.0 等评测上比 Haiku 4.5 大幅提升。
  • 它支持文本和图片输入,据 Anthropic 称可在编程工作中与 Opus 5.5 或 Sonnet 5.5 搭配,担任子代理。
  • 自适应思考默认开启,由 effort 设置控制思考量。

什么情况换别的模型

  • Anthropic 称,对复杂的智能体编程和开放式工作,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。
  • 安全分类器可能以 refusal 停止原因拒绝请求,网络安全防护仍会拦截渗透测试。
  • 不支持手动设置思考预算,由自适应思考加 effort 设置取代。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Messages API
    POST/v1/messages
    API 格式:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-5-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

价格

TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

输入 token <= 100K

每 1M token
官方价格
输入 $0.10 / 输出 $0.50 / 缓存读取 $0.01 / 缓存写入 $0.125
TokenLab 价格
输入 $0.03 / 输出 $0.15 / 缓存读取 $0.003 / 缓存写入 $0.0375
折扣
-70%

输入 token 100K-1M

每 1M token
官方价格
输入 $0.50 / 输出 $2.50 / 缓存读取 $0.05 / 缓存写入 $0.625
TokenLab 价格
输入 $0.15 / 输出 $0.75 / 缓存读取 $0.015 / 缓存写入 $0.1875
折扣
-70%
提示词缓存价格

缓存读取

官方价格
$0.01
TokenLab 价格
$0.003
折扣
-70%

缓存写入

官方价格
$0.125
TokenLab 价格
$0.0375
折扣
-70%
工具附加费

按次计费,仅在模型实际使用工具时收取。

网页搜索

官方价格
$0.01/次搜索
TokenLab 价格
$0.003/次搜索
折扣
-70%

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Claude Haiku 5.5 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 claude-haiku-5-5 发一条简短消息,接口是 /v1/messages。返回回复,附上延迟和费用。

使用场景

适用场景
  • 推理
  • 视觉
  • 大批量分类与路由

    给工单打标签、分发请求、从文档中提取字段,适合对响应速度和吞吐稳定性要求最高的大批量场景。

  • 编程流程中的子代理

    在更大的模型主导工作时,处理搜索代码库、总结文件等范围明确的支线任务,这是 Anthropic 重点提到的搭配。

  • 实时客服与浏览器任务

    实时回答客户,或根据截图执行浏览器步骤,轮次之间的等待时间决定了体验。

  • 摘要与上下文压缩

    把长对话、财报或日志压缩成简短摘要,并在步骤之间压缩智能体的上下文。

提示词示例

把这 50 条客服工单分别归为账单、故障或功能需求,并返回包含工单编号和类别的 JSON 列表。

阅读这份财报,把公司名称、财年、营收和净利润整理成表格,找不到的数值请标明。

用六条要点总结到目前为止的对话,保留每个决定、未解决的问题和文件名,方便新的智能体接着做。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Claude Haiku 5.5 最擅长什么?

范围明确的大批量工作:分类、信息抽取、路由、摘要、上下文压缩和子代理任务。Anthropic 把它定位为最快的模型,并说对复杂的智能体编程,Sonnet 5.5 或 Opus 5.5 仍然更好。

Haiku 5.5 应该从哪个 effort 等级开始?

Anthropic 建议大多数工作,包括智能体编程,从默认的 medium 开始。聊天、简短工具任务和简单的大批量请求用 low,不过在很长的智能体提示中,low 可能漏掉搜索或提前停止。需要严格遵循指令时用 high,只有自己的测试显示有收益时才用 xhigh 或 max。

Haiku 5.5 可以关闭思考吗?

部分可以。思考是自适应的,默认开启。发送 thinking disabled 在 low、medium 和 high 下可用,在 xhigh 和 max 下会返回错误。Anthropic 更推荐的做法是降低 effort 等级来减少思考。思考内容计入输出上限,所以要留出空间。

Haiku 5.5 和 Haiku 4.5 有什么区别?

Anthropic 称它的评测成绩大幅提升,上下文窗口和输出上限更大,支持可调 effort,并用自适应思考取代手动思考预算。它使用较新的分词器,同样的文字会计为更多 token,其安全分类器还可能返回 Haiku 4.5 没有的拒绝。

什么时候该选 Sonnet 5.5 而不是 Haiku 5.5?

复杂的智能体编程、长时间的终端会话和需要持续判断的任务,选 Sonnet 5.5 或 Opus 5.5,Anthropic 说它们在这些场景更强。速度和规模更重要、任务范围明确时,如分类、摘要或子代理工作,选 Haiku 5.5。

Claude Haiku 5.5 的费用是多少?

在 TokenLab 上,Claude Haiku 5.5 的价格为 输入 $0.03 / 输出 $0.15 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Claude Haiku 5.5 的上下文窗口和输出上限是多少?

Claude Haiku 5.5 最多接收 1,000,000 token 的上下文,单次最多返回 128,000 token。

Claude Haiku 5.5 应该使用哪个端点?

Claude Haiku 5.5 使用 https://api.tokenlab.sh/v1/messages。代码写法见下方的请求示例。

Claude Haiku 5.5 支持哪些操作?

Claude Haiku 5.5 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Claude Haiku 5.5 对比

资料来源

审阅于 2026年10月8日

更多 Claude 5 模型

相关模型