
Prompt Caching 成本指南:Cache Hits、Prefixes 與實際 API 支出
根據 2026-10-03 觀察到的 TokenLab 價格,在 claude-sonnet-5 上,一個 20,000-token 的系統提示詞(system prompt)在未快取的情況下,每 1,000 次請求估計成本為 18.18 美元,若有快取命中則約為 2.00 美元。
為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態
TokenLab 部落格

根據 2026-10-03 觀察到的 TokenLab 價格,在 claude-sonnet-5 上,一個 20,000-token 的系統提示詞(system prompt)在未快取的情況下,每 1,000 次請求估計成本為 18.18 美元,若有快取命中則約為 2.00 美元。

OpenRouter 與 TokenLab 的技術比較,探討單一結構定義正規化與跨 OpenAI、Anthropic 和 Gemini 端點的多格式原生閘道路由。

從 OpenAI 遷移至 TokenLab,首先需要更改 `base_url` 和 `api_key`,接著根據過時的說明文件,檢查 model ID、串流(streaming)、工具呼叫(tool calls)、錯誤格式(error shapes)、逾時設定(timeouts)以及計費方式。

編碼代理(coding agent)不應因為模型名稱的變更而崩潰。以下說明 MCP 模型目錄(model catalog)如何將模型選擇轉變為執行時(runtime)查找,並包含請求範例、路由規則以及驗證習慣。

TokenLab 的一份過時的四模型串流範例顯示了為何必須分別測量首個可見 token (first visible token)、總時間 (total time) 以及每秒 token 數 (tokens per second),並需配合測試工具 (harness)、用於記錄的標頭 (headers) 以及速率限制計算 (rate-limit math)。

因為模型字串變更而導致 404 錯誤,絕對不是啟動 Agent 迴圈的好開始。以下說明如何鎖定 `gemini-3.5-flash`、讀取 Google Cloud 定價,並建立一個能應對棄用(deprecations)的迴圈。