為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: Qwen Flash

Qwen Flash 具備大型上下文視窗,可處理日常文字任務。它是高容量摘要、內容轉換以及需要將長篇原始素材保留在對話中的助理之候選模型。
比較模型
qwen-flash
可用Alibaba對話
輸入 / 輸出
$0.05 / $0.40
上下文
998K
最大輸出長度
32K
模態
對話
能力
提示詞快取推理

關於 Qwen Flash

Qwen Flash 是阿里巴巴 Qwen 系列中快速、低成本的通用文字模型,旨在處理高流量工作,如摘要、改寫及簡單的助理任務。其能力低於 Qwen Plus 和 Qwen Max,當處理量比深度更重要時,它是首選。阿里巴巴將其列為舊版 Qwen 名稱,建議新專案使用較新的 Qwen3 世代。

適用場景

  • 以低延遲處理大量文字的摘要與重新格式化。
  • 在摘要或回答時,將冗長的原始文件保持在對話上下文中。
  • 選配的思考模式讓您僅在需要時才消耗推理資源。
  • 提示詞快取(Prompt caching)可減少重複使用長系統提示詞或文件時的重複運算。

其他選擇建議

  • 僅限文字輸入,不支援工具呼叫。
  • 在困難的分析任務上,其推理深度與寫作品質不及 Qwen Plus 和 Qwen Max。
  • 阿里巴巴將其列為舊版名稱,因此目前的 Qwen3 模型可能更適合新專案。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉文字Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen-flash",
        "input": "Hello!"
      }'

定價

Verified 價格用於 Verified,多數模型更便宜;Official 價格是模型廠商公布的價格,用於更穩定的 Official。Auto 按最終完成請求的線路計價。

輸入 權杖 <= 125K

每 1M Token
Official 價格
輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40
Verified 價格
—
折扣
—

輸入 權杖 <= 250K

每 1M Token
Official 價格
輸入 $0.05 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.0625 / 純文字 輸入 $0.05 / 純文字 輸出 $0.40
Verified 價格
—
折扣
—

輸入 權杖 <= 1M

每 1M Token
Official 價格
輸入 $0.25 / 輸出 $2.00 / 快取讀取 $0.05 / 快取寫入 $0.3125 / 純文字 輸入 $0.25 / 純文字 輸出 $2.00
Verified 價格
—
折扣
—
Prompt 快取價格

快取讀取

Official 價格
$0.01
Verified 價格
—
折扣
—

快取寫入

Official 價格
$0.0625
Verified 價格
—
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Qwen Flash,並準備好編輯或發送提示詞。

協助我使用 qwen-flash 透過 /v1/responses 進行對話,並顯示回覆、延遲與成本。

應用情境

適合場景
  • 推理
  • 批量摘要

    將數千篇文章、通話逐字稿或評論濃縮為簡短摘要,並對每個項目套用相同的提示詞。

  • 內容轉換

    在語氣、語言或格式之間轉換文字,例如將筆記轉為精煉的電子郵件,或將表格轉為散文。

  • 輕量級聊天助理

    支援 FAQ 機器人或應用程式內輔助工具,適用於回答簡短且回應速度比細微差別更重要的場景。

  • 長文件問答

    將長篇手冊或政策文件貼入提示詞中,並直接根據內容回答員工問題。

提示詞範例

請以友善的語氣重寫以下產品描述,字數限制在 60 字以內,並保留模型編號不變。

請將此會議逐字稿總結為決策事項、負責人待辦事項以及未決問題。

僅使用上述政策文本回答:承包商可以申請差旅費嗎?請引用您所使用的條款。

此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。

FAQ

Qwen Flash 最適合什麼用途?

高流量、日常文字任務:摘要、改寫、翻譯類轉換及簡單的助理任務。它是 Qwen 系列中快速且經濟實惠的層級,因此當吞吐量重要且任務不需要深度推理時,請使用它。

Qwen Flash 與 Qwen Plus 有何不同?

Flash 是速度導向層級,而 Plus 是均衡型層級。Plus 提供更強的分析與寫作能力;Flash 則能更快、更便宜地完成簡單工作。建議從 Flash 開始,若回答效果不佳,再將特定任務轉移至 Plus。

Qwen Flash 支援思考模式嗎?

支援。對於需要逐步推理的請求可以開啟思考模式,簡單的請求則可關閉。阿里巴巴的文件將思考模式列為此模型的支援功能。

Qwen Flash 可以處理圖像或呼叫工具嗎?

不行。這是一個純文字輸入、文字輸出的模型,不支援圖像輸入或工具呼叫。若請求需要這些功能,請選擇 Qwen 視覺模型或其他系列。

Qwen Flash 是新專案的好選擇嗎?

現有的管線可以繼續使用它,且它對於穩定的高流量工作依然適用。對於全新的建置,阿里巴巴建議使用較新的 Qwen3 世代,因此請先與 Qwen3.8 Flash 進行比較。

Qwen Flash 的費用是多少?

在 TokenLab 上,Qwen Flash 價格為 輸入 $0.05 / 輸出 $0.40 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Qwen Flash 的上下文長度與輸出限制為何?

Qwen Flash 支援最高 997,952 tokens 的上下文,單次回應上限為 32,768 tokens。

Qwen Flash 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/responses 進行 Qwen Flash 的呼叫。下方的請求範例展示了對應的程式碼格式。

Qwen Flash 支援哪些操作?

Qwen Flash 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 Qwen Flash

來源

更新於 2026年10月2日

更多來自 Qwen 的模型

相關模型