每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Qwen Flash

Qwen Flash 面向日常文本任务,提供长上下文,适合高频摘要、内容转换,以及需要在对话中保留较长原始资料的助手。
对比模型
qwen-flash
可用Alibaba聊天
输入 / 输出
$0.05 / $0.40
上下文
998K
最大输出
32K
模态
聊天
能力
提示词缓存推理

Qwen Flash 简介

Qwen Flash 是阿里巴巴 Qwen 系列中快速、低成本的通用文本模型,面向摘要、改写和简单助手这类大批量任务。能力排在 Qwen Plus 和 Qwen Max 之下,在量比深度更重要时先试它。阿里巴巴把它列在 Qwen 旧名称之中,新项目推荐用较新的 Qwen3 系列。

擅长的任务

  • 大批量文本的摘要和格式转换,单次请求延迟低。
  • 在做摘要或回答时,把很长的资料文档留在对话里。
  • 可选的思考模式,只在需要的请求上花推理成本。
  • 长系统提示词或文档被重复使用时,提示词缓存可以减少重复计算。

什么情况换别的模型

  • 只支持文本输入,不支持工具调用。
  • 推理深度和写作质量在困难的分析任务上不及 Qwen Plus 和 Qwen Max。
  • 阿里巴巴把它列为旧名称,新项目可能更适合用当前的 Qwen3 模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen-flash",
        "input": "Hello!"
      }'

价格

Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

输入 token <= 125K

每 1M token
Official 价格
输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40
Verified 价格
—
折扣
—

输入 token <= 250K

每 1M token
Official 价格
输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40
Verified 价格
—
折扣
—

输入 token <= 1M

每 1M token
Official 价格
输入 $0.25 / 输出 $2.00 / 缓存读取 $0.05 / 缓存写入 $0.3125 / 文本 输入 $0.25 / 文本 输出 $2.00
Verified 价格
—
折扣
—
提示词缓存价格

缓存读取

Official 价格
$0.01
Verified 价格
—
折扣
—

缓存写入

Official 价格
$0.0625
Verified 价格
—
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Qwen Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 qwen-flash 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。

使用场景

适用场景
  • 推理
  • 批量摘要

    把成千上万篇文章、通话转录或评论压缩成简短摘要,每一条都用同一个提示词。

  • 内容转换

    在不同语气、语言或格式之间转换文本,比如把笔记写成一封得体的邮件,或把表格改写成文字。

  • 轻量聊天助手

    支撑常见问题机器人或应用内助手,回答简短,响应时间比细腻程度更重要。

  • 长文档问答

    把很长的手册或制度集放进提示词,直接据此回答员工的问题。

提示词示例

用亲切的语气改写下面的产品描述,最多 60 字,型号保持不变。

把这份会议转录稿总结为:决策、带负责人的待办事项、未决问题。

只根据上面的制度文本回答:外包人员可以报销差旅费用吗?引用你依据的条款。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Qwen Flash 最适合做什么?

大批量的日常文本任务:摘要、改写、翻译式的转换和简单助手。它是 Qwen 系列里快速、便宜的一档,吞吐量重要、任务不需要深度推理时用它。

Qwen Flash 和 Qwen Plus 有什么区别?

Flash 是偏重速度的一档,Plus 是均衡的一档。Plus 的分析和写作更强;Flash 处理简单任务更快更便宜。先用 Flash,如果回答不够好,再把特定任务转给 Plus。

Qwen Flash 支持思考模式吗?

支持。需要逐步推理的请求可以打开思考,简单的请求就关掉。阿里巴巴文档列出此模型支持思考模式。

Qwen Flash 能读图片或调用工具吗?

不能。它是文本输入、文本输出的模型,没有图像输入或工具调用。请求需要这两样时,请选 Qwen 的视觉模型或其他系列。

新项目适合选 Qwen Flash 吗?

现有流水线可以继续用它,稳定的大批量任务仍然可用。全新搭建时,阿里巴巴建议看较新的 Qwen3 系列,所以先和 Qwen3.8 Flash 比较。

Qwen Flash 的费用是多少?

在 TokenLab 上,Qwen Flash 的价格为 输入 $0.05 / 输出 $0.40 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Qwen Flash 的上下文窗口和输出上限是多少?

Qwen Flash 最多接收 997,952 token 的上下文,单次最多返回 32,768 token。

Qwen Flash 应该使用哪个端点?

Qwen Flash 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。

Qwen Flash 支持哪些操作?

Qwen Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Qwen Flash 对比

资料来源

审阅于 2026年10月2日

更多 Qwen 模型

相关模型