每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash 面向 3.5 系列中注重效率的长文本任务,适合摘要和反复处理文档的流程,在整个任务中持续参考较大的原始资料。
对比模型
qwen3.5-flash
可用Alibaba聊天
输入 / 输出
$0.10 / $0.40
上下文
992K
最大输出
64K
模态
聊天
能力
提示词缓存

Qwen3.5-Flash 简介

Qwen3.5-Flash 是阿里巴巴 Qwen3.5 系列里较轻的托管版本,处理文本比 Qwen3.5-Plus 更快、更便宜。它有非常大的上下文和提示词缓存,适合做摘要,以及对同一份大型资料反复处理。它与整个系列一样,语言覆盖面很广。

擅长的任务

  • 提示词缓存有助于反复查阅同一份大型资料。
  • 速度上比 Plus 档做过调优。
  • 沿用 Qwen3.5 系列对 201 种语言的覆盖。
  • 适合摘要、打标签等流水线环节。

什么情况换别的模型

  • 较难的分析任务,Qwen3.5-Plus 表现更好。
  • 只接收文本,不能替代视觉模型。
  • 比 Qwen3.8-Flash 旧,后者公布了智能体编程方面的成绩。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

价格

TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

输入 token <= 125K

每 1M token
官方价格
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
Official
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
折扣
—

输入 token <= 250K

每 1M token
官方价格
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
Official
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
折扣
—

输入 token <= 1M

每 1M token
官方价格
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
Official
输入 $0.10 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.125 / 文本 输入 $0.10 / 文本 输出 $0.40
折扣
—
提示词缓存价格

缓存读取

官方价格
$0.01
Official
$0.01
折扣
—

缓存写入

官方价格
$0.125
Official
$0.125
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Qwen3.5-Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 qwen3.5-flash 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。

使用场景

  • 批量摘要

    在夜间流水线里压缩长报告,同一份大型资料在你询问的各个章节之间保持缓存。

  • 文档打标签与分发

    按主题、紧急程度或负责人给长文本打标签,并以固定格式返回,方便下游代码解析。

  • 针对同一份资料反复问答

    把一份手册或政策缓存一次,然后对它提出很多问题,不必每一轮都为重新处理全文付费。

  • 草稿润色

    修正长草稿的语法、语气和结构,同时不改动作者的论点和数字。

提示词示例

用两行话概括这本手册的每一个章节。

给这张工单打上产品领域和紧急程度标签,返回 JSON。

根据贴出的政策回答问题;如果政策里没有提到,就回答“未说明”。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Qwen3.5-Flash 到底是什么?

它是阿里巴巴 Qwen3.5 系列里较轻的托管版本,用于快速处理长文本。能力排在 Qwen3.5-Plus 之下,适合重复的常规文档处理环节。

什么时候选 Flash 而不是 Qwen3.5-Plus?

速度和成本比深度更重要时选 Flash,比如批量摘要、打标签,或针对固定资料的问答。答案需要对多个段落做更细致的分析时,换成 Plus。

Qwen3.5-Flash 支持提示词缓存吗?

支持。同一份长资料被反复发送时,提示词缓存很有帮助,比如重复的文档处理环节,每次调用之间只有问题在变。

Qwen3.5-Flash 能看图吗?

不能。Qwen3.5-Flash 只接收文本。任务涉及截图、扫描件或图表时,请用 Qwen3.8-Flash、Qwen3.7-Plus 或 Qwen3-VL Plus,再把提取出的文本交给这个模型。

阿里巴巴有更新的 Flash 模型吗?

有。Qwen3.8-Flash 是更新的多模态混合专家模型,面向智能体编程和长周期的智能体工作。已经表现不错的纯文本流水线可以继续用 Qwen3.5-Flash。

Qwen3.5-Flash 的费用是多少?

在 TokenLab 上,Qwen3.5-Flash 的价格为 输入 $0.10 / 输出 $0.40 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Qwen3.5-Flash 的上下文窗口和输出上限是多少?

Qwen3.5-Flash 最多接收 991,808 token 的上下文,单次最多返回 65,536 token。

Qwen3.5-Flash 应该使用哪个端点?

Qwen3.5-Flash 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。

Qwen3.5-Flash 支持哪些操作?

Qwen3.5-Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Qwen3.5-Flash 对比

资料来源

审阅于 2026年10月2日

更多 Qwen 3 / QwQ 模型

相关模型