Alibaba: Qwen Flash
qwen-flash- 输入 / 输出
- $0.05 / $0.40
- 上下文
- 998K
- 最大输出
- 32K
- 模态
- 聊天
- 能力
- 提示词缓存推理
Qwen Flash 简介
Qwen Flash 是阿里巴巴 Qwen 系列中快速、低成本的通用文本模型,面向摘要、改写和简单助手这类大批量任务。能力排在 Qwen Plus 和 Qwen Max 之下,在量比深度更重要时先试它。阿里巴巴把它列在 Qwen 旧名称之中,新项目推荐用较新的 Qwen3 系列。
擅长的任务
- 大批量文本的摘要和格式转换,单次请求延迟低。
- 在做摘要或回答时,把很长的资料文档留在对话里。
- 可选的思考模式,只在需要的请求上花推理成本。
- 长系统提示词或文档被重复使用时,提示词缓存可以减少重复计算。
什么情况换别的模型
- 只支持文本输入,不支持工具调用。
- 推理深度和写作质量在困难的分析任务上不及 Qwen Plus 和 Qwen Max。
- 阿里巴巴把它列为旧名称,新项目可能更适合用当前的 Qwen3 模型。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Responses APIPOST/v1/responsesAPI 格式:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
价格
Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。
输入 token <= 125K
每 1M token- Official 价格
- 输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40
- Verified 价格
- —
- 折扣
- —
输入 token <= 250K
每 1M token- Official 价格
- 输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40
- Verified 价格
- —
- 折扣
- —
输入 token <= 1M
每 1M token- Official 价格
- 输入 $0.25 / 输出 $2.00 / 缓存读取 $0.05 / 缓存写入 $0.3125 / 文本 输入 $0.25 / 文本 输出 $2.00
- Verified 价格
- —
- 折扣
- —
缓存读取
- Official 价格
- $0.01
- Verified 价格
- —
- 折扣
- —
缓存写入
- Official 价格
- $0.0625
- Verified 价格
- —
- 折扣
- —
| Official 价格每 1M token | Verified 价格每 1M token | 折扣 | |
|---|---|---|---|
| 输入 token <= 125K | 输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40 | — | — |
| 输入 token <= 250K | 输入 $0.05 / 输出 $0.40 / 缓存读取 $0.01 / 缓存写入 $0.0625 / 文本 输入 $0.05 / 文本 输出 $0.40 | — | — |
| 输入 token <= 1M | 输入 $0.25 / 输出 $2.00 / 缓存读取 $0.05 / 缓存写入 $0.3125 / 文本 输入 $0.25 / 文本 输出 $2.00 | — | — |
| 提示词缓存价格 | |||
| 缓存读取 | $0.01 | — | — |
| 缓存写入 | $0.0625 | — | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Qwen Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 qwen-flash 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。
使用场景
适用场景- 推理
批量摘要
把成千上万篇文章、通话转录或评论压缩成简短摘要,每一条都用同一个提示词。
内容转换
在不同语气、语言或格式之间转换文本,比如把笔记写成一封得体的邮件,或把表格改写成文字。
轻量聊天助手
支撑常见问题机器人或应用内助手,回答简短,响应时间比细腻程度更重要。
长文档问答
把很长的手册或制度集放进提示词,直接据此回答员工的问题。
提示词示例
用亲切的语气改写下面的产品描述,最多 60 字,型号保持不变。
把这份会议转录稿总结为:决策、带负责人的待办事项、未决问题。
只根据上面的制度文本回答:外包人员可以报销差旅费用吗?引用你依据的条款。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Qwen Flash 最适合做什么?
大批量的日常文本任务:摘要、改写、翻译式的转换和简单助手。它是 Qwen 系列里快速、便宜的一档,吞吐量重要、任务不需要深度推理时用它。
Qwen Flash 和 Qwen Plus 有什么区别?
Flash 是偏重速度的一档,Plus 是均衡的一档。Plus 的分析和写作更强;Flash 处理简单任务更快更便宜。先用 Flash,如果回答不够好,再把特定任务转给 Plus。
Qwen Flash 支持思考模式吗?
支持。需要逐步推理的请求可以打开思考,简单的请求就关掉。阿里巴巴文档列出此模型支持思考模式。
Qwen Flash 能读图片或调用工具吗?
不能。它是文本输入、文本输出的模型,没有图像输入或工具调用。请求需要这两样时,请选 Qwen 的视觉模型或其他系列。
新项目适合选 Qwen Flash 吗?
现有流水线可以继续用它,稳定的大批量任务仍然可用。全新搭建时,阿里巴巴建议看较新的 Qwen3 系列,所以先和 Qwen3.8 Flash 比较。
Qwen Flash 的费用是多少?
在 TokenLab 上,Qwen Flash 的价格为 输入 $0.05 / 输出 $0.40 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Qwen Flash 的上下文窗口和输出上限是多少?
Qwen Flash 最多接收 997,952 token 的上下文,单次最多返回 32,768 token。
Qwen Flash 应该使用哪个端点?
Qwen Flash 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。
Qwen Flash 支持哪些操作?
Qwen Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Qwen Flash 对比
资料来源
审阅于 2026年10月2日