為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

用於快速 Agent 迴圈的 Gemini 3.5 Flash API

·2026年9月19日·約 6 分鐘閱讀·更新 2026年9月26日·1528 次瀏覽
#程式設計#AI API#TokenLab
用於快速 Agent 迴圈的 Gemini 3.5 Flash API

因為模型字串變動而遇到 404 錯誤,絕對不是啟動 Agent 迴圈的好開始。Gemini 3.5 Flash API 非常值得整合進快速 Agent 迴圈中,但前提是你必須先對照即時模型列表確認確切的 gemini-3.5-flash 模型 ID。Google Cloud 在標準 Global 層級列出的 Gemini 3.5 Flash 定價為每 100 萬個輸入 token 1.50 美元,每 100 萬個輸出文字 token 9.00 美元;Flex/Batch 定價則為輸入 0.75 美元,輸出 4.50 美元。我們在原始資料中看到了同樣的陷阱:今天能用的模型 ID 明天可能會拋出 404 錯誤。網路上常見的定價表往往將已確認的供應商定價與未經交叉比對的目錄清單混在一起。本指南將涵蓋目前可驗證的資訊、不可驗證的資訊,以及如何建立一個在模型 ID 變更時不會崩潰的 Agent 迴圈。

重點摘要

  • Google Cloud 的 Agent Platform 定價頁面列出 Gemini 3.5 Flash 在標準 Global 層級的價格為每百萬 token 輸入 1.50 美元、輸出 9.00 美元,與更新時 TokenLab 的目錄清單相符。
  • 應鎖定的確切模型字串為 gemini-3.5-flash;Google 的 Gemini API 模型頁面將其列為穩定模型的範例。儘管如此,部署前仍請透過即時模型列表進行確認。
  • 透過 TokenLab 的統一 API 進行路由,意味著你不必硬編碼特定供應商的 SDK 字串;TokenLab 會將穩定的模型代稱(slug)對應到目前有效的底層識別碼。
  • 下表中的競爭對手價格(GPT-5.5、Claude Sonnet 5、DeepSeek V4 Flash)僅來自 TokenLab 的目錄。本次審閱未提供這些模型的獨立供應商定價頁面——在進行預算編列前,請務必直接向 OpenAI、Anthropic 和 DeepSeek 確認。
  • 此處未引用任何基準延遲數據(首個 token 時間、完整的 5 步驟迴圈持續時間),因為沒有獨立來源。請自行檢測你的迴圈,並測量每個步驟的 p50/p95,而不是引用二手數據。
  • 在 Agent 迴圈中,輸出 token 通常佔據主要成本——Gemini 3.5 Flash 的輸出費率(每百萬 9.00 美元)是其輸入費率(每百萬 1.50 美元)的 6 倍,因此限制 max_output_tokens 比縮減提示詞長度更重要。

來源快照

來源 涵蓋內容 觀察日期
Google Cloud Agent Platform 定價 Gemini 3.5 Flash 標準、快取輸入以及 Flex/Batch token 定價 2026-07-08
Google Gemini API 模型頁面 穩定模型命名指引;gemini-3.5-flash 被列為穩定模型範例 2026-07-08
TokenLab 模型與定價目錄 Google、Anthropic、OpenAI 和 DeepSeek 旗下 gemini-3.5-flash 與競爭對手模型的每 token 定價 2026-07-08

Google Cloud 的 Gemini Enterprise Agent Platform 將 Gemini 3.5 Flash 列在獨立的定價表中,與 Gemini Developer API 定價頁面分開。標準 Global 費率為每百萬輸入 token 1.50 美元,每百萬輸出文字 token 9.00 美元。Flex/Batch Global 費率降至輸入 0.75 美元,輸出 4.50 美元。標準層級的快取輸入為每百萬 token 0.15 美元。這直接證明了 Gemini 3.5 Flash 是一個穩定、普遍可用且針對 Google Cloud 企業級 Agent 工作負載定價的模型,而非佔位符或預覽標籤。讀者在比較各文章的成本時,應先確認費率是從哪個定價頁面提取的,再將數據視為可互換。

Gemini 3.5 Flash API 的模型與成本比較

以下所有數據均為 TokenLab 目錄清單。標記為「與供應商確認」的列未提供本次審閱的獨立引用來源。

模型 供應商 Context window 輸入 $/M tokens 輸出 $/M tokens 備註
gemini-3.5-flash Google 1,048,576 $1.50 $9.00 TokenLab 目錄;請對照 Google 即時定價頁面確認
gemini-3.1-flash-lite Google n/a $0.25 $1.50 TokenLab 目錄
gemini-3-pro-image Google n/a $2.00 $12.00 TokenLab 目錄,影像層級;請勿作為文字 Agent 的替代品
gpt-5 OpenAI n/a $1.25 $10.00 TokenLab 目錄
gpt-5.5 OpenAI 1,050,000 $5.00 $30.00 TokenLab 目錄 - 請與 OpenAI 確認
claude-sonnet-5 Anthropic 1,000,000 $2.00 $10.00 TokenLab 目錄 - 請與 Anthropic 確認
claude-haiku-4-5 Anthropic n/a $1.00 $5.00 TokenLab 目錄
deepseek-v4-flash DeepSeek 1,048,576 $0.09 $0.18 TokenLab 目錄 - 請與 DeepSeek 確認

對於進行多次小型工具呼叫的 Agent 迴圈而言,最低的每 token 費率並不總是代表最低的每任務成本——需要較少重試次數或較短推理路徑的模型,往往能勝過單價較低的模型。請測量每個已完成任務的成本,而不僅僅是每個 token 的成本。

Gemini 3.5 Flash API 的實作步驟

  1. 在編寫程式碼前確認模型 ID。在更新時,應鎖定的模型 ID 為 gemini-3.5-flash,且 Google 的模型文件將其列為穩定模型範例。但在部署前,仍請呼叫供應商的模型列表端點或檢查 TokenLab 的目錄。這是解決「SDK 拋出錯誤」問題的方法:該字串在呼叫時不存在。任何重試邏輯都無法修復錯誤的識別碼。例如,原始資料直接描述了該失敗模式。

  2. 透過統一端點進行路由,而非使用原始供應商 SDK。使用 TokenLab(或類似的閘道)意味著你的應用程式程式碼參考的是穩定的代稱,而閘道會將其解析為供應商當前有效的識別碼。這能將你的 Agent 迴圈與供應商端的模型重新命名或棄用脫鉤。

  3. 建立具有明確步驟與檢測功能的迴圈:

# 僅為示意結構 - 部署前請對照閘道當前文件確認確切端點/模型欄位。
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

在我們的管線中,我們會記錄每次執行的 timings,並計算一組具代表性任務的 p50/p95。請勿發布或依賴從他人環境中提取的固定「每迴圈 N 秒」數據——網路狀況、提示詞長度以及供應商負載都會改變這些數字。

  1. 刻意限制輸出 token。根據上述目錄定價,gemini-3.5-flash 的輸出 token 成本約為輸入 token 的 6 倍。我們測試了定價計算。請為每個步驟設定 max_output_tokens,而不是讓模型無限輸出。這在合成步驟(synthesis step)中尤為重要,因為該步驟通常會產生冗長的回答。

  2. 增加備援鏈(fallback chain)。設定次要模型(例如為了成本考量使用 gemini-3.1-flash-lite,或完全不同的供應商),確保單一模型中斷或棄用不會導致整個 Agent 停擺。

何時使用 TokenLab

  • 你需要穩定的模型代稱,而不是脆弱的供應商字串。TokenLab 的目錄方法意味著當供應商重新命名或棄用模型時,你的程式碼不需要重寫。Google 自身的 Veo 3.0 預計於 2026 年 6 月 30 日關閉,這顯示了其中的風險。
  • 你需要一個地方在決定供應商前比較各家的成本,而不是每次評估模型更換時都要手動檢查四個不同的定價頁面。
  • 你正在執行多供應商備援邏輯,並希望在 Google、Anthropic、OpenAI 和 DeepSeek 模型之間保持一致的請求/回應格式,而不是維護四個獨立的 SDK 整合。

相關閱讀

常見問題

gemini-3.5-flash 是我可以透過 Google SDK 直接呼叫的有效模型 ID 嗎?

請勿假設如此。部署前請務必對照 Google 當前的模型列表進行確認——模型 ID 字串會變更,且預覽/GA 狀態也會隨時間調整。如果你是透過 TokenLab 進行路由,閘道會為你處理此對應關係。

比較表中的競爭對手價格來自哪裡?

它們是 TokenLab 的目錄清單。本文中只有 Veo 影片定價追溯至獨立標註日期的 Google 來源(觀察日期 2026-07-08)。此處的 GPT-5.5、Claude Sonnet 5 和 DeepSeek V4 Flash 定價未提供獨立引用來源——在將這些數字用於客戶端成本估算前,請務必與各供應商確認。

5 步驟的 Gemini 3.5 Flash Agent 迴圈有多快?

此處未包含基準數據,因為本文沒有獨立來源。請檢測你自己的迴圈(參見上述程式碼範例),並測量你環境中的實際 p50/p95 延遲,而不是依賴二手數據。

如果我使用的模型在專案進行中被棄用會怎樣?

這正是 Google Veo 3.0 關閉(2026 年 6 月 30 日)所說明的情境。請建立備援鏈,並在可能的情況下透過維護更新模型代稱的閘道進行路由,這樣棄用就不需要重寫程式碼。

建立 TokenLab API 金鑰,以便在部署前比較當前的模型 ID。

來源

價格觀測於 2026-07-08

相關模型

最近發布的模型

用本文涉及的模型開始構建

比較價格、測試路由,把文章研究直接變成可執行的 API 呼叫。