每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Google: Gemini 3.1 Flash-Lite

低延迟的 Gemini 模型,面向高吞吐的多模态与智能体负载
对比模型
gemini-3.1-flash-lite
可用Google聊天缓存输入便宜 90%
输入 / 输出-50%
$0.25 / $1.50$0.125 / $0.75
上下文
1M
发布日期
2026年5月7日
最大输出
64K
模态
视觉聊天
能力
工具调用提示词缓存

Gemini 3.1 Flash-Lite 简介

Gemini 3.1 Flash-Lite 是 Google Gemini 3.1 系列中低延迟、低成本的模型,面向高并发的多模态和智能体负载。Google 称它以很低的成本达到可与更大模型相比的前沿级性能。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,支持上下文缓存,能力排在 Flash 档之下。

擅长的任务

  • 响应时间短,适合每次调用都要快速返回的交互功能。
  • 图片和文本放进同一个请求,适合处理收据、表单和截图。
  • 受 schema 约束的 JSON 输出,省去了解析自由文本的脆弱环节。
  • 工具调用和上下文缓存,支持大规模重复、相似的智能体步骤。

什么情况换别的模型

  • 做长时间、多步骤的编码智能体,Flash 和 Pro 模型比 Lite 模型更可靠。
  • 它不是以推理为先的模型;高难度数学或深度规划,更适合交给 Gemini 3.1 Pro。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Gemini API
    POST/v1beta/models/gemini-3.1-flash-lite:generateContent
    API 格式:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

价格

Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

默认规格

每 1M token
Official 价格
输入 $0.25 / 输出 $1.50 / 缓存读取 $0.025
Verified 价格
输入 $0.125 / 输出 $0.75 / 缓存读取 $0.0125
折扣
-50%
提示词缓存价格

缓存读取

Official 价格
$0.025
Verified 价格
$0.0125
折扣
-50%
工具附加费

按次计费,仅在模型实际使用工具时收取。

网页搜索

Official 价格
$0.014/次搜索
Verified 价格
$0.007/次搜索
折扣
-50%

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
30 天成功率
100.0%
30 天请求数
40K+
最后活动时间
7分钟前

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Gemini 3.1 Flash-Lite 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 gemini-3.1-flash-lite 发一条简短消息,接口是 /v1beta/models/gemini-3.1-flash-lite:generateContent。返回回复,附上延迟和费用。

使用场景

适用场景
  • 视觉
  • 批量提取

    从成千上万张发票或表单中取出字段,每个结果写成经过校验的 JSON 对象。

  • 内容审核和打标签

    按固定政策给用户上传的内容和评论打标签,并附一句理由。

  • 路由层

    判断请求该交给哪个专用模型或工具,然后转发出去。

  • 实时助手

    驱动自动补全、快速回复或语音助手的对话轮次,这些场景里看得见的等待会损害用户体验。

提示词示例

从这张发票图片中提取供应商、日期、总额和币种,并以 JSON 返回。

把下面的评论标记为 spam、abuse、question 或 praise,并用一句话解释理由。

给定这条用户消息,从 search_docs、create_ticket、answer_directly 中选一个,只回复工具名。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Gemini 3.1 Flash-Lite 最适合做什么?

高并发、对延迟敏感的任务,比如提取、分类、打标签、路由和快速的多模态回答。它用一部分推理深度换来速度,每次调用的负载也更轻。

它接受图片吗?

接受。文本和图片可以混合放在一个请求里,所以它能读文档、截图和照片。回答以文本形式返回,或返回符合你 schema 的 JSON。

它能调用工具吗?

能。支持函数调用,所以它可以充当第一级智能体,为简单请求选择工具,或把难题转交给更大的模型。

它和 Gemini 3.5 Flash-Lite 有什么不同?

3.5 Flash-Lite 是更新的一代,也是 Google 现在为新项目推荐的;3.1 Flash-Lite 是较早的 Lite 模型,仍属稳定版。切换流量前,先用自己的提示词测试两者。

Gemini 3.1 Flash-Lite 的费用是多少?

在 TokenLab 上,Gemini 3.1 Flash-Lite 的价格为 输入 $0.125 / 输出 $0.75 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Gemini 3.1 Flash-Lite 的上下文窗口和输出上限是多少?

Gemini 3.1 Flash-Lite 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。

Gemini 3.1 Flash-Lite 应该使用哪个端点?

Gemini 3.1 Flash-Lite 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent。代码写法见下方的请求示例。

Gemini 3.1 Flash-Lite 支持哪些操作?

Gemini 3.1 Flash-Lite 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Gemini 3.1 Flash-Lite 对比

用到 Gemini 3.1 Flash-Lite 的指南

资料来源

审阅于 2026年10月2日

更多 Gemini 3 模型

相关模型