為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Google: Gemini 3.1 Flash-Lite

用於高流量多模態與代理工作負載的低延遲 Gemini 模型
比較模型
gemini-3.1-flash-lite
可用Google對話輸入快取節省 90%
輸入 / 輸出-50%
$0.25 / $1.50$0.125 / $0.75
上下文
1M
發布日期
2026年5月7日
最大輸出長度
64K
模態
視覺辨識對話
能力
工具使用提示詞快取

關於 Gemini 3.1 Flash-Lite

Gemini 3.1 Flash-Lite 是 Google Gemini 3.1 系列中低延遲、低成本的模型,專為高容量多模態與代理(agent)工作負載而建。Google 將其描述為具備媲美大型模型的邊緣級效能,且成本僅為其一小部分。它能讀取文字與圖像、呼叫工具、回傳符合架構的 JSON,並支援上下文快取,其能力定位在 Flash 等級之下。

適用場景

  • 短回應時間使其適合互動式功能,在這些功能中,每次呼叫都必須快速回傳結果。
  • 圖像與文字可放入同一個請求中,適合處理收據、表單和螢幕截圖。
  • 符合架構的 JSON 輸出消除了對自由文字進行脆弱解析的需求。
  • 工具呼叫與上下文快取支援大規模重複且相似的代理步驟。

其他選擇建議

  • 對於長步驟的程式編寫代理,Flash 和 Pro 模型比 Lite 模型表現更穩定。
  • 這不是以推理為主的模型;困難的數學運算或深度規劃建議交給 Gemini 3.1 Pro。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉文字Gemini API
    POST/v1beta/models/gemini-3.1-flash-lite:generateContent
    API 格式:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

定價

Verified 價格用於 Verified,多數模型更便宜;Official 價格是模型廠商公布的價格,用於更穩定的 Official。Auto 按最終完成請求的線路計價。

預設規格

每 1M Token
Official 價格
輸入 $0.25 / 輸出 $1.50 / 快取讀取 $0.025
Verified 價格
輸入 $0.125 / 輸出 $0.75 / 快取讀取 $0.0125
折扣
-50%
Prompt 快取價格

快取讀取

Official 價格
$0.025
Verified 價格
$0.0125
折扣
-50%
工具費用

僅在模型呼叫工具時,依使用次數計費。

網路搜尋

Official 價格
$0.014/次搜尋
Verified 價格
$0.007/次搜尋
折扣
-50%

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
近 30 日成功率
100.0%
近 30 日請求數
40K+
最後活動時間
14 分鐘前

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Gemini 3.1 Flash-Lite,並準備好編輯或發送提示詞。

協助我使用 gemini-3.1-flash-lite 透過 /v1beta/models/gemini-3.1-flash-lite:generateContent 進行對話,並顯示回覆、延遲與成本。

應用情境

適合場景
  • 視覺辨識
  • 批次提取

    從數千份發票或表單中提取欄位,並將每個結果寫入為經過驗證的 JSON 物件。

  • 內容審核與標記

    根據固定政策標記使用者上傳的內容與評論,並附上一行理由。

  • 路由層

    決定請求應傳送至哪個專業模型或工具,然後進行轉發。

  • 即時助理

    支援自動完成、快速回覆或語音助理對話,避免明顯的等待時間影響使用者體驗。

提示詞範例

從這張發票圖像中提取供應商、日期、總金額與幣別,並以 JSON 格式回傳。

將下方的評論標記為垃圾訊息、濫用、問題或讚美,並用一句話解釋選擇原因。

根據此使用者訊息,從下列選項中選擇一個:search_docs、create_ticket、answer_directly。僅回覆工具名稱。

此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。

FAQ

Gemini 3.1 Flash-Lite 最適合做什麼?

高容量、對延遲敏感的工作,例如提取、分類、標記、路由和快速多模態回答。它以犧牲部分推理深度來換取速度與較輕的單次呼叫負載。

它接受圖像嗎?

可以。文字與圖像可以在同一個請求中混合使用,因此它可以讀取文件、螢幕截圖和照片。其回答會以文字形式回傳,或以符合您架構的 JSON 格式回傳。

它可以呼叫工具嗎?

可以。支援函式呼叫,這使其能作為第一階段的代理,針對簡單請求選擇工具,或將困難案例轉發給較大型的模型。

它與 Gemini 3.5 Flash-Lite 有何不同?

3.5 Flash-Lite 是較新的世代,也是 Google 目前引導新專案使用的版本;3.1 Flash-Lite 是較舊的 Lite 模型,但仍然穩定。在轉移流量之前,請先在兩者上測試您的提示詞。

Gemini 3.1 Flash-Lite 的費用是多少?

在 TokenLab 上,Gemini 3.1 Flash-Lite 價格為 輸入 $0.125 / 輸出 $0.75 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Gemini 3.1 Flash-Lite 的上下文長度與輸出限制為何?

Gemini 3.1 Flash-Lite 支援最高 1,048,576 tokens 的上下文,單次回應上限為 65,536 tokens。

Gemini 3.1 Flash-Lite 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent 進行 Gemini 3.1 Flash-Lite 的呼叫。下方的請求範例展示了對應的程式碼格式。

Gemini 3.1 Flash-Lite 支援哪些操作?

Gemini 3.1 Flash-Lite 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 Gemini 3.1 Flash-Lite

使用 Gemini 3.1 Flash-Lite 的指南

來源

更新於 2026年10月2日

更多來自 Gemini 3 的模型

相關模型