Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- 輸入 / 輸出-50%
- $0.25 / $1.50$0.125 / $0.75
- 上下文
- 1M
- 發布日期
- 2026年5月7日
- 最大輸出長度
- 64K
- 模態
- 視覺辨識對話
- 能力
- 工具使用提示詞快取
關於 Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite 是 Google Gemini 3.1 系列中低延遲、低成本的模型,專為高容量多模態與代理(agent)工作負載而建。Google 將其描述為具備媲美大型模型的邊緣級效能,且成本僅為其一小部分。它能讀取文字與圖像、呼叫工具、回傳符合架構的 JSON,並支援上下文快取,其能力定位在 Flash 等級之下。
適用場景
- 短回應時間使其適合互動式功能,在這些功能中,每次呼叫都必須快速回傳結果。
- 圖像與文字可放入同一個請求中,適合處理收據、表單和螢幕截圖。
- 符合架構的 JSON 輸出消除了對自由文字進行脆弱解析的需求。
- 工具呼叫與上下文快取支援大規模重複且相似的代理步驟。
其他選擇建議
- 對於長步驟的程式編寫代理,Flash 和 Pro 模型比 Lite 模型表現更穩定。
- 這不是以推理為主的模型;困難的數學運算或深度規劃建議交給 Gemini 3.1 Pro。
入門指南
建立 API 金鑰
請至 Console 建立金鑰,即可在平台上使用各類模型。
發送您的第一個請求
複製您所選語言的範例,並針對端點執行它。
文字轉文字Gemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentAPI 格式:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
定價
Verified 價格用於 Verified,多數模型更便宜;Official 價格是模型廠商公布的價格,用於更穩定的 Official。Auto 按最終完成請求的線路計價。
預設規格
每 1M Token- Official 價格
- 輸入 $0.25 / 輸出 $1.50 / 快取讀取 $0.025
- Verified 價格
- 輸入 $0.125 / 輸出 $0.75 / 快取讀取 $0.0125
- 折扣
- -50%
快取讀取
- Official 價格
- $0.025
- Verified 價格
- $0.0125
- 折扣
- -50%
僅在模型呼叫工具時,依使用次數計費。
網路搜尋
- Official 價格
- $0.014/次搜尋
- Verified 價格
- $0.007/次搜尋
- 折扣
- -50%
| Official 價格每 1M Token | Verified 價格每 1M Token | 折扣 | |
|---|---|---|---|
| 預設規格 | 輸入 $0.25 / 輸出 $1.50 / 快取讀取 $0.025 | 輸入 $0.125 / 輸出 $0.75 / 快取讀取 $0.0125 | -50% |
| Prompt 快取價格 | |||
| 快取讀取 | $0.025 | $0.0125 | -50% |
| 工具費用僅在模型呼叫工具時,依使用次數計費。 | |||
| 網路搜尋 | $0.014/次搜尋 | $0.007/次搜尋 | -50% |
使用量與活動
成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。
用量與可用性
過去 24 小時- 請求數
- 成功率
- P95 延遲
- 總 Token 用量
- 近 30 日成功率
- 100.0%
- 近 30 日請求數
- 40K+
- 最後活動時間
- 14 分鐘前
資料基於彙總的使用者請求,不包含狀態檢查。
直接在 Console 裡試
在 Console 中開啟 Gemini 3.1 Flash-Lite,並準備好編輯或發送提示詞。
協助我使用 gemini-3.1-flash-lite 透過 /v1beta/models/gemini-3.1-flash-lite:generateContent 進行對話,並顯示回覆、延遲與成本。
應用情境
適合場景- 視覺辨識
批次提取
從數千份發票或表單中提取欄位,並將每個結果寫入為經過驗證的 JSON 物件。
內容審核與標記
根據固定政策標記使用者上傳的內容與評論,並附上一行理由。
路由層
決定請求應傳送至哪個專業模型或工具,然後進行轉發。
即時助理
支援自動完成、快速回覆或語音助理對話,避免明顯的等待時間影響使用者體驗。
提示詞範例
從這張發票圖像中提取供應商、日期、總金額與幣別,並以 JSON 格式回傳。
將下方的評論標記為垃圾訊息、濫用、問題或讚美,並用一句話解釋選擇原因。
根據此使用者訊息,從下列選項中選擇一個:search_docs、create_ticket、answer_directly。僅回覆工具名稱。
此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。
FAQ
Gemini 3.1 Flash-Lite 最適合做什麼?
高容量、對延遲敏感的工作,例如提取、分類、標記、路由和快速多模態回答。它以犧牲部分推理深度來換取速度與較輕的單次呼叫負載。
它接受圖像嗎?
可以。文字與圖像可以在同一個請求中混合使用,因此它可以讀取文件、螢幕截圖和照片。其回答會以文字形式回傳,或以符合您架構的 JSON 格式回傳。
它可以呼叫工具嗎?
可以。支援函式呼叫,這使其能作為第一階段的代理,針對簡單請求選擇工具,或將困難案例轉發給較大型的模型。
它與 Gemini 3.5 Flash-Lite 有何不同?
3.5 Flash-Lite 是較新的世代,也是 Google 目前引導新專案使用的版本;3.1 Flash-Lite 是較舊的 Lite 模型,但仍然穩定。在轉移流量之前,請先在兩者上測試您的提示詞。
Gemini 3.1 Flash-Lite 的費用是多少?
在 TokenLab 上,Gemini 3.1 Flash-Lite 價格為 輸入 $0.125 / 輸出 $0.75 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。
Gemini 3.1 Flash-Lite 的上下文長度與輸出限制為何?
Gemini 3.1 Flash-Lite 支援最高 1,048,576 tokens 的上下文,單次回應上限為 65,536 tokens。
Gemini 3.1 Flash-Lite 應該使用哪一個端點?
請使用 https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent 進行 Gemini 3.1 Flash-Lite 的呼叫。下方的請求範例展示了對應的程式碼格式。
Gemini 3.1 Flash-Lite 支援哪些操作?
Gemini 3.1 Flash-Lite 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。
比較 Gemini 3.1 Flash-Lite
使用 Gemini 3.1 Flash-Lite 的指南
來源
更新於 2026年10月2日