Alibaba: Qwen Flash
qwen-flash- 輸入 / 輸出
- $0.05 / $0.40
- 上下文
- 998K
- 最大輸出長度
- 32K
- 模態
- 對話
- 能力
- 提示詞快取推理
關於 Qwen Flash
Qwen Flash 是阿里巴巴 Qwen 系列中快速、低成本的通用文字模型,旨在處理高流量工作,如摘要、改寫及簡單的助理任務。其能力低於 Qwen Plus 和 Qwen Max,當處理量比深度更重要時,它是首選。阿里巴巴將其列為舊版 Qwen 名稱,建議新專案使用較新的 Qwen3 世代。
適用場景
- 以低延遲處理大量文字的摘要與重新格式化。
- 在摘要或回答時,將冗長的原始文件保持在對話上下文中。
- 選配的思考模式讓您僅在需要時才消耗推理資源。
- 提示詞快取(Prompt caching)可減少重複使用長系統提示詞或文件時的重複運算。
其他選擇建議
- 僅限文字輸入,不支援工具呼叫。
- 在困難的分析任務上,其推理深度與寫作品質不及 Qwen Plus 和 Qwen Max。
- 阿里巴巴將其列為舊版名稱,因此目前的 Qwen3 模型可能更適合新專案。
入門指南
建立 API 金鑰
請至 Console 建立金鑰,即可在平台上使用各類模型。
發送您的第一個請求
複製您所選語言的範例,並針對端點執行它。
文字轉文字Responses APIPOST/v1/responsesAPI 格式:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
定價
Verified 價格用於 Verified,多數模型更便宜;Official 價格是模型廠商公布的價格,用於更穩定的 Official。Auto 按最終完成請求的線路計價。
輸入 權杖 <= 125K
每 1M Token- Official 價格
- 輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40
- Verified 價格
- —
- 折扣
- —
輸入 權杖 <= 250K
每 1M Token- Official 價格
- 輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40
- Verified 價格
- —
- 折扣
- —
輸入 權杖 <= 1M
每 1M Token- Official 價格
- 輸入 $0.25 / 輸出 $2.00 / 快取讀取 $0.05 / 快取寫入 $0.3125 / 純文字 輸入 $0.25 / 純文字 輸出 $2.00
- Verified 價格
- —
- 折扣
- —
快取讀取
- Official 價格
- $0.01
- Verified 價格
- —
- 折扣
- —
快取寫入
- Official 價格
- $0.0625
- Verified 價格
- —
- 折扣
- —
| Official 價格每 1M Token | Verified 價格每 1M Token | 折扣 | |
|---|---|---|---|
| 輸入 權杖 <= 125K | 輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40 | — | — |
| 輸入 權杖 <= 250K | 輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40 | — | — |
| 輸入 權杖 <= 1M | 輸入 $0.25 / 輸出 $2.00 / 快取讀取 $0.05 / 快取寫入 $0.3125 / 純文字 輸入 $0.25 / 純文字 輸出 $2.00 | — | — |
| Prompt 快取價格 | |||
| 快取讀取 | $0.01 | — | — |
| 快取寫入 | $0.0625 | — | — |
使用量與活動
成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。
用量與可用性
過去 24 小時- 請求數
- 成功率
- P95 延遲
- 總 Token 用量
資料基於彙總的使用者請求,不包含狀態檢查。
直接在 Console 裡試
在 Console 中開啟 Qwen Flash,並準備好編輯或發送提示詞。
協助我使用 qwen-flash 透過 /v1/responses 進行對話,並顯示回覆、延遲與成本。
應用情境
適合場景- 推理
批量摘要
將數千篇文章、通話逐字稿或評論濃縮為簡短摘要,並對每個項目套用相同的提示詞。
內容轉換
在語氣、語言或格式之間轉換文字,例如將筆記轉為精煉的電子郵件,或將表格轉為散文。
輕量級聊天助理
支援 FAQ 機器人或應用程式內輔助工具,適用於回答簡短且回應速度比細微差別更重要的場景。
長文件問答
將長篇手冊或政策文件貼入提示詞中,並直接根據內容回答員工問題。
提示詞範例
請以友善的語氣重寫以下產品描述,字數限制在 60 字以內,並保留模型編號不變。
請將此會議逐字稿總結為決策事項、負責人待辦事項以及未決問題。
僅使用上述政策文本回答:承包商可以申請差旅費嗎?請引用您所使用的條款。
此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。
FAQ
Qwen Flash 最適合什麼用途?
高流量、日常文字任務:摘要、改寫、翻譯類轉換及簡單的助理任務。它是 Qwen 系列中快速且經濟實惠的層級,因此當吞吐量重要且任務不需要深度推理時,請使用它。
Qwen Flash 與 Qwen Plus 有何不同?
Flash 是速度導向層級,而 Plus 是均衡型層級。Plus 提供更強的分析與寫作能力;Flash 則能更快、更便宜地完成簡單工作。建議從 Flash 開始,若回答效果不佳,再將特定任務轉移至 Plus。
Qwen Flash 支援思考模式嗎?
支援。對於需要逐步推理的請求可以開啟思考模式,簡單的請求則可關閉。阿里巴巴的文件將思考模式列為此模型的支援功能。
Qwen Flash 可以處理圖像或呼叫工具嗎?
不行。這是一個純文字輸入、文字輸出的模型,不支援圖像輸入或工具呼叫。若請求需要這些功能,請選擇 Qwen 視覺模型或其他系列。
Qwen Flash 是新專案的好選擇嗎?
現有的管線可以繼續使用它,且它對於穩定的高流量工作依然適用。對於全新的建置,阿里巴巴建議使用較新的 Qwen3 世代,因此請先與 Qwen3.8 Flash 進行比較。
Qwen Flash 的費用是多少?
在 TokenLab 上,Qwen Flash 價格為 輸入 $0.05 / 輸出 $0.40 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。
Qwen Flash 的上下文長度與輸出限制為何?
Qwen Flash 支援最高 997,952 tokens 的上下文,單次回應上限為 32,768 tokens。
Qwen Flash 應該使用哪一個端點?
請使用 https://api.tokenlab.sh/v1/responses 進行 Qwen Flash 的呼叫。下方的請求範例展示了對應的程式碼格式。
Qwen Flash 支援哪些操作?
Qwen Flash 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。
比較 Qwen Flash
來源
更新於 2026年10月2日