為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash 是 3.5 系列中針對長上下文文字工作進行效率優化的選項。它支援摘要與重複性的文件處理步驟,適用於在整個任務過程中需要持續參考同一大型來源的場景。
比較模型
qwen3.5-flash
可用Alibaba對話
輸入 / 輸出
$0.10 / $0.40
上下文
992K
最大輸出長度
64K
模態
對話
能力
提示詞快取

關於 Qwen3.5-Flash

Qwen3.5-Flash 是阿里巴巴 Qwen3.5 系列中較輕量的託管版本,專為比 Qwen3.5-Plus 更快速、更低成本的文字處理而設計。它擁有極大的上下文窗口和提示詞快取(prompt caching)功能,適合用於摘要以及對同一大型來源進行重複處理。它同樣具備該系列廣泛的語言覆蓋能力。

適用場景

  • 提示詞快取有助於對單一大型來源進行重複查詢。
  • 針對速度進行了優化,優於 Plus 版本。
  • 共享 Qwen3.5 系列的 201 種語言覆蓋能力。
  • 非常適合摘要或標記等流水線步驟。

其他選擇建議

  • Qwen3.5-Plus 在處理較困難的分析任務時表現更佳。
  • 它僅支援文字輸入,因此無法取代視覺模型。
  • 發布時間早於 Qwen3.8-Flash,後者具備代理式編碼(agentic coding)結果。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉文字Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

定價

Verified 享有 TokenLab 優惠價,多數模型更划算。Official 採用原廠定價,提供更穩定的服務。Auto 模式將依據實際完成請求的管道進行計費。

輸入 權杖 <= 125K

每 1M Token
Official 定價
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
Official
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
折扣
—

輸入 權杖 <= 250K

每 1M Token
Official 定價
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
Official
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
折扣
—

輸入 權杖 <= 1M

每 1M Token
Official 定價
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
Official
輸入 $0.10 / 輸出 $0.40 / 快取讀取 $0.01 / 快取寫入 $0.125 / 純文字 輸入 $0.10 / 純文字 輸出 $0.40
折扣
—
Prompt 快取價格

快取讀取

Official 定價
$0.01
Official
$0.01
折扣
—

快取寫入

Official 定價
$0.125
Official
$0.125
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Qwen3.5-Flash,並準備好編輯或發送提示詞。

協助我使用 qwen3.5-flash 透過 /v1/responses 進行對話,並顯示回覆、延遲與成本。

應用情境

  • 批次摘要

    在夜間流水線中濃縮長篇報告,並針對您詢問的各個部分快取同一大型來源。

  • 文件標記與路由

    按主題、緊急程度或負責人對長文本進行標記,並以下游程式碼可解析的固定格式返回結果。

  • 針對單一來源的重複問答

    將手冊或政策文件快取一次,即可針對其提出多個問題,無需在每次查詢時支付重新處理全文的費用。

  • 草稿潤飾

    修正長篇草稿中的語法、語氣和結構,同時保持作者的觀點和數據不變。

提示詞範例

將這本手冊的每個章節總結為兩行。

為此工單標記產品領域和緊急程度,並返回 JSON 格式。

回答關於所貼政策的問題;若內容未提及,請回覆「未說明」。

此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。

FAQ

Qwen3.5-Flash 究竟是什麼?

它是阿里巴巴 Qwen3.5 系列中較輕量的託管版本,旨在快速處理長文本。其能力層級低於 Qwen3.5-Plus,專為重複性的常規文件處理步驟而設計。

什麼時候應該選擇 Flash 而不是 Qwen3.5-Plus?

當速度和成本比深度更重要時,請選擇 Flash,例如進行大量摘要、標記或針對固定來源的問答。當答案需要跨多個段落進行更仔細的分析時,請改用 Plus。

Qwen3.5-Flash 是否支援提示詞快取?

是的。當同一長篇來源被反覆發送時,提示詞快取非常有用,例如在重複的文件處理步驟中,只有問題在每次呼叫之間發生變化。

Qwen3.5-Flash 能讀取圖片嗎?

不能。Qwen3.5-Flash 僅支援文字。若任務涉及螢幕截圖、掃描件或圖表,請使用 Qwen3.8-Flash、Qwen3.7-Plus 或 Qwen3-VL Plus,並將提取出的文字發送給此模型。

阿里巴巴是否有更新的 Flash 模型?

有的。Qwen3.8-Flash 是一款較新的多模態混合專家模型,旨在處理代理式編碼和長視角代理任務。對於表現良好的純文字流水線,請繼續使用 Qwen3.5-Flash。

Qwen3.5-Flash 的費用是多少?

在 TokenLab 上,Qwen3.5-Flash 價格為 輸入 $0.10 / 輸出 $0.40 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Qwen3.5-Flash 的上下文長度與輸出限制為何?

Qwen3.5-Flash 支援最高 991,808 tokens 的上下文,單次回應上限為 65,536 tokens。

Qwen3.5-Flash 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/responses 進行 Qwen3.5-Flash 的呼叫。下方的請求範例展示了對應的程式碼格式。

Qwen3.5-Flash 支援哪些操作?

Qwen3.5-Flash 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 Qwen3.5-Flash

來源

更新於 2026年10月2日

更多來自 Qwen 3 / QwQ 的模型

相關模型