為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

適合 Agent 的最佳平價 AI 模型:成本與故障模式

·2026年9月19日·約 9 分鐘閱讀·更新 2026年9月26日·1506 次瀏覽
#AI 代理#LLM 成本優化#模型路由#開發者工具
適合 Agent 的最佳平價 AI 模型:成本與故障模式

在我們的代理程式(agent)管線中,單一 token 最便宜的模型,很少是完成單一任務時成本最低的模型。當我們測試代理程式的最佳平價 AI 模型時,發現工具呼叫(tool calls)、JSON 修復以及思維鏈(chain-of-thought)產生的輸出 token 佔據了大部分支出。DeepSeek V4 Flash、Gemini 3.5 Flash、Claude Sonnet 5、GPT-5.5、GLM-5.2 和 Laguna XS 2.1 是我們目前可以討論的單一事實來源(SSOT)範例。下方的 TokenLab 目錄價格觀察於 2026-09-19;外部價格未註明日期,需經供應商確認。我們未發布延遲基準測試,因為在更新時無法取得這些特定路徑的受控 TTFT、tokens/sec 或重試率數據集。請將此視為成本與失敗模式的候選清單,並在您自己的迴圈中進行延遲基準測試。

重點摘要

  • 輸出成本對代理程式支出的影響大於輸入成本。代理程式透過工具呼叫、重試和 JSON 產生的 token 數量,遠多於每輪消耗的 token。
  • 在目前具有 TokenLab 目錄價格的 SSOT 範例中,DeepSeek V4 Flash 是我們在此能驗證的最低輸出成本項目,每 MTok 輸入 $0.147 / 輸出 $0.294。
  • 模型名稱衝突是真實存在的。DeepSeek V4 Flash 出現了兩種價格:TokenLab 目錄中的 $0.147/$0.294,以及外部清單中的 $0.09/$0.18。
  • 影片和圖像生成定價(PixVerse、fal、Black Forest Labs)並非 LLM token 定價的證據。它不應作為文字代理程式成本的引用來源,我們已將其與下方內容分開。
  • Claude Sonnet 5、GLM-5.2、Kimi K2.7 Code、Qwen3.7 Plus 等模型的外部比較價格缺乏註明日期的公開來源 URL。在編列預算前,請務必與各供應商的定價頁面進行核對。
  • 單一 token 最便宜不代表單一任務最便宜。若模型在工具呼叫時失敗或截斷 JSON,將導致重試,進而抵銷節省的成本。

來源快照與失敗模式

來源 內容類型 觀察日期 與本文之關聯性
PixVerse Platform Docs (docs.platform.pixverse.ai) 影片生成定價 2026-07-08 不用於 LLM 聲明 - 僅限影片,包含於此僅為透明度考量
fal PixVerse V6 model page (fal.ai/pixverse-v6) 影片生成定價 2026-07-08 不用於 LLM 聲明 - 僅限影片
Black Forest Labs pricing docs (docs.bfl.ml) 圖像生成定價 2026-07-08 不用於 LLM 聲明 - 僅限圖像
TokenLab 內部模型目錄 第一方 LLM 與媒體定價 2026-09-19 下方所有 TokenLab 目錄價格的主要來源
個別供應商定價頁面 (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) LLM 定價 本數據集未註明日期 在公開預算聲明前必須獨立驗證

PixVerse、fal 和 BFL 來源存在於我們的研究集中,是因為我們在進行更廣泛的媒體定價掃描時將其納入。它們描述的是按秒計費的影片和按圖像計費的點數成本,與按 token 計費的 LLM 定價無關。我們將其列出是為了讓讀者了解我們排除它們的原因。我們不會將其用於 LLM 相關聲明。

在我們的管線中,我們會記錄工具呼叫重試率、截斷的 JSON、遺漏的工具呼叫以及產生的幻覺函數參數,並將其與 token 支出一併記錄。由於在更新時我們沒有這些特定路徑的受控重試率數據集,因此無法發布相關比率。例如,一個 $0.05/MTok 的模型若有 15% 的工具呼叫失敗,其重試成本可能高於一個失敗率僅 2% 的 $1/MTok 模型。這種失敗模式的計算,而非標價,才是您選擇平價層級時應考量的重點。

最佳平價 AI 代理程式模型與成本比較

下方所有價格均為 TokenLab 自身的第一方目錄清單(按 token 計算,以 $/MTok 表示),觀察於 2026-09-19。它們是本文中 LLM 代理程式成本聲明的正確依據。

模型 供應商 輸入 $/MTok 輸出 $/MTok 代理程式適用性
DeepSeek V4 Flash DeepSeek $0.147 $0.294 TokenLab 目錄中目前最便宜的輸出密集型 SSOT 選項;比較外部報價前請確認確切模型 ID
Gemini 3.5 Flash Google $1.50 $9.00 多模態代理程式步驟(圖像 + 文字工具使用)
Claude Sonnet 5 Anthropic $2.00 $10.00 保留用於代理程式輸出的最終驗證/QA 階段
GPT-5.5 OpenAI $5.00 $30.00 複雜規劃或模糊工具選擇時的備援方案
Claude Opus 4.8 Anthropic $5.00 $25.00 旗艦級比較;在代理程式迴圈內很少有必要使用
Claude Fable 5 Anthropic $10.00 $50.00 頂級上限
GLM-5.2 Z.ai $0.93 $3.00 低成本路由的開放權重範例
Kimi K2.7 Code Moonshot AI $0.74 $3.50 程式設計代理程式範例
Qwen3.7 Plus Alibaba/Qwen $0.32 $1.28 低成本路由範例
MiniMax M3 MiniMax $0.30 $1.20 低成本路由範例
DeepSeek V4 Pro DeepSeek $0.441 $0.882 同一系列中較重的推理子任務

我們保留下方的外部數據以供審計連續性使用,並將每一行標記為未驗證。請勿將其用於預算編列。確切細節必須與當前文件進行確認。

模型 供應商 輸入 $/MTok 輸出 $/MTok 驗證狀態
DeepSeek V4 Flash (外部清單) DeepSeek $0.09 $0.18 與上述 TokenLab 目錄不同 - 請確認此指涉的產品/層級;我們的來源集中無註明日期的來源 URL
MiniMax M3 MiniMax $0.30 $1.20 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
Qwen3.7 Plus Alibaba/Qwen $0.32 $1.28 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
Kimi K2.7 Code Moonshot AI $0.74 $3.50 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
GLM-5.2 Z.ai $0.93 $3.00 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
Claude Sonnet 5 Anthropic $2.00 $10.00 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
Claude Opus 4.8 Anthropic $5.00 $25.00 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
GPT-5.5 Batch/Flex OpenAI $2.50 $15.00 我們的來源集中無註明日期的來源 URL;非標準 GPT-5.5 項目
GPT-5.5 OpenAI $5.00 $30.00 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認
Claude Fable 5 Anthropic $10.00 $50.00 我們的來源集中無註明日期的來源 URL;請對照供應商文件確認

已退役的目錄價格點不再對應目前的 SSOT 模型名稱。我們保留這些數字以供審計連續性使用,但在未經供應商確認的情況下,我們不會將新的代理程式工作路由至這些未命名的層級。

已退役或非 SSOT 層級 輸入 $/MTok 輸出 $/MTok 狀態
已退役超低成本層級 $0.05 $0.40 不再是目前的 SSOT 範例;使用前請確認後繼者
已退役低成本 flash-lite 層級 $0.25 $1.50 不再是目前的 SSOT 範例;請映射至 Gemini 3.5 Flash 或 DeepSeek V4 Flash 並確認
已退役低成本 mini 層級 $0.25 $2.00 不再是目前的 SSOT 範例;請映射至 Claude Sonnet 5 或 DeepSeek V4 Flash 並確認
已退役小型驗證層級 $1.00 $5.00 不再是目前的 SSOT 範例;請映射至 Claude Sonnet 5 並確認
已退役中階備援層級 $1.25 $10.00 不再是目前的 SSOT 範例;請映射至 GPT-5.5 並確認
已退役頂級上限 $15.00 $120.00 不再是目前的 SSOT 範例;請映射至 GPT-5.5 或 Claude Fable 5 並確認

代理程式最佳平價 AI 模型的實作注意事項

  1. 依據任務進行分層,而非僅依賴單一最便宜的模型。將路由、分類和工具選擇任務導向 DeepSeek V4 Flash 或 Gemini 3.5 Flash。將多步驟規劃升級至 DeepSeek V4 Pro 或 GPT-5.5。保留 Claude Sonnet 5 用於最終答案驗證。
  2. 在平價層級積極限制輸出 token。由於輸出成本佔據代理程式支出的主導地位,請對 DeepSeek V4 Flash 和 Gemini 3.5 Flash 的呼叫設定嚴格的 max-token 限制。僅在升級層級允許較長的生成。
  3. 記錄每個模型的失敗模式,而不僅是每次呼叫的成本。將截斷的 JSON、遺漏的工具呼叫和幻覺函數參數與 token 支出分開追蹤。例如,一個 $0.05/MTok 的模型若有 15% 的工具呼叫失敗,其重試成本可能高於一個失敗率僅 2% 的 $1/MTok 模型。
  4. 在程式碼中鎖定確切的模型 ID,絕不要使用別名。鑑於上述顯示的命名衝突(兩種不同的 DeepSeek V4 Flash 價格點),請將完整的供應商和模型字串寫入程式碼。每次供應商更新時請重新驗證定價。
  5. 每季重新檢查外部定價。本文中任何沒有註明日期的來源 URL 的價格,在出現在客戶導向的成本估算之前,都應從供應商的即時定價頁面重新獲取。

以下是一個使用本文中目錄模型名稱的路由草圖。確切的 TokenLab 請求格式和工具呼叫錯誤欄位必須在生產環境使用前,於 TokenLab API 文件中確認。

路由草圖,非 TokenLab API 合約。請在 TokenLab API 文件中確認請求格式。
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
    若工具呼叫遺失或 JSON 被截斷,則重試一次
    if 回應包含有效的工具呼叫與有效的 JSON:
        return 回應
    log 該模型的失敗模式
若最終層級失敗,則拋出錯誤

此草圖顯示了重試邊界:捕捉工具呼叫錯誤、記錄失敗模式,然後移至下一個模型。在生產環境使用前,請確認當前 TokenLab API 文件中的請求格式和錯誤欄位。

TokenLab 如何整合代理程式路由

  • 單一目錄減少了跨供應商帳戶管理的繁瑣。TokenLab 在一個 API 和計費介面下整合了 OpenAI、Google、Anthropic 和 DeepSeek 的定價層級。將工作流程步驟從 DeepSeek V4 Flash 切換至 Gemini 3.5 Flash 僅需更改配置,無需進行新的整合。
  • 可供審計的第一方、註明日期的定價。與分散的第三方報價不同,本文中的 TokenLab 目錄數字是從平台自身的清單中提取,觀察於 2026-09-19。這就是為什麼它們是此處唯一無需「必須驗證」警告的價格。
  • 代理程式管線的內建分層。由於 TokenLab 同時託管平價層級和升級層級模型,您可以對 DeepSeek V4 Flash、Gemini 3.5 Flash 和 Claude Sonnet 5 進行成本與失敗率的 A/B 測試。您無需重新架構代理程式的路由邏輯。

相關閱讀

常見問題

為什麼我會看到 DeepSeek V4 Flash 有兩種價格?

DeepSeek V4 Flash 在我們的來源集中出現了兩種價格點:TokenLab 目錄中的 $0.147/$0.294,以及外部清單中的 $0.09/$0.18。模型名稱會在不同供應商和經銷商之間重複使用並重新定價。請在程式碼中鎖定確切的供應商和模型 ID,然後對照供應商的即時文件進行重新驗證,而非僅僅信任名稱。

我可以使用外部參考價格來編列預算嗎?

目前還不行。這些項目在我們的來源集中缺乏註明日期的來源 URL,因此我們將其標記為需要供應商確認。TokenLab 目錄數據是規劃基礎,而外部表格僅是您自行驗證的起點,而非最終數字。確切細節必須與當前文件進行確認。

哪一個目前的 SSOT 模型最適合生產環境的代理程式?

在具有 TokenLab 目錄價格的目前 SSOT 範例中,以輸出成本而言,DeepSeek V4 Flash 是我們在此能驗證的最低價格,為每 MTok 輸出 $0.294。外部清單顯示為每 MTok 輸出 $0.18,但該數字需要供應商確認。請在考量您特定工具呼叫架構的重試率後,衡量哪一個最便宜。

如果本文是關於 LLM 定價,為什麼要引用 PixVerse、fal 和 BFL?

它們並非作為任何 LLM 定價聲明的證據。它們出現在「來源快照」表格中僅是為了我們更廣泛的研究掃描透明度,並明確標記為不用於 LLM 聲明。模型與成本比較表格中的每一個金額均來自 TokenLab 自身的目錄,或被標記為未驗證。

工具呼叫重試如何改變最便宜模型的選擇?

一個便宜的模型若在工具呼叫時失敗或截斷 JSON,將迫使系統重試,而這些重試會增加輸出 token。例如,一個 $0.05/MTok 的模型若有 15% 的工具呼叫失敗,其重試成本可能高於一個失敗率僅 2% 的 $1/MTok 模型。在我們的管線中,我們記錄每個模型的重試率,並比較「完成單一任務的成本」,而非「單一 token 的成本」。

立即探索 TokenLab 模型目錄並開始比較成本:TokenLab 模型目錄。

來源

價格觀測於 2026-07-07

相關模型

最近發布的模型

用本文涉及的模型開始構建

比較價格、測試路由,把文章研究直接變成可執行的 API 呼叫。