Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- 输入 / 输出-50%
- $0.25 / $1.50$0.125 / $0.75
- 上下文
- 1M
- 发布日期
- 2026年5月7日
- 最大输出
- 64K
- 模态
- 视觉聊天
- 能力
- 工具调用提示词缓存
Gemini 3.1 Flash-Lite 简介
Gemini 3.1 Flash-Lite 是 Google Gemini 3.1 系列中低延迟、低成本的模型,面向高并发的多模态和智能体负载。Google 称它以很低的成本达到可与更大模型相比的前沿级性能。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,支持上下文缓存,能力排在 Flash 档之下。
擅长的任务
- 响应时间短,适合每次调用都要快速返回的交互功能。
- 图片和文本放进同一个请求,适合处理收据、表单和截图。
- 受 schema 约束的 JSON 输出,省去了解析自由文本的脆弱环节。
- 工具调用和上下文缓存,支持大规模重复、相似的智能体步骤。
什么情况换别的模型
- 做长时间、多步骤的编码智能体,Flash 和 Pro 模型比 Lite 模型更可靠。
- 它不是以推理为先的模型;高难度数学或深度规划,更适合交给 Gemini 3.1 Pro。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Gemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentAPI 格式:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
价格
Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。
默认规格
每 1M token- Official 价格
- 输入 $0.25 / 输出 $1.50 / 缓存读取 $0.025
- Verified 价格
- 输入 $0.125 / 输出 $0.75 / 缓存读取 $0.0125
- 折扣
- -50%
缓存读取
- Official 价格
- $0.025
- Verified 价格
- $0.0125
- 折扣
- -50%
按次计费,仅在模型实际使用工具时收取。
网页搜索
- Official 价格
- $0.014/次搜索
- Verified 价格
- $0.007/次搜索
- 折扣
- -50%
| Official 价格每 1M token | Verified 价格每 1M token | 折扣 | |
|---|---|---|---|
| 默认规格 | 输入 $0.25 / 输出 $1.50 / 缓存读取 $0.025 | 输入 $0.125 / 输出 $0.75 / 缓存读取 $0.0125 | -50% |
| 提示词缓存价格 | |||
| 缓存读取 | $0.025 | $0.0125 | -50% |
| 工具附加费按次计费,仅在模型实际使用工具时收取。 | |||
| 网页搜索 | $0.014/次搜索 | $0.007/次搜索 | -50% |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
- 30 天成功率
- 100.0%
- 30 天请求数
- 40K+
- 最后活动时间
- 7分钟前
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Gemini 3.1 Flash-Lite 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 gemini-3.1-flash-lite 发一条简短消息,接口是 /v1beta/models/gemini-3.1-flash-lite:generateContent。返回回复,附上延迟和费用。
使用场景
适用场景- 视觉
批量提取
从成千上万张发票或表单中取出字段,每个结果写成经过校验的 JSON 对象。
内容审核和打标签
按固定政策给用户上传的内容和评论打标签,并附一句理由。
路由层
判断请求该交给哪个专用模型或工具,然后转发出去。
实时助手
驱动自动补全、快速回复或语音助手的对话轮次,这些场景里看得见的等待会损害用户体验。
提示词示例
从这张发票图片中提取供应商、日期、总额和币种,并以 JSON 返回。
把下面的评论标记为 spam、abuse、question 或 praise,并用一句话解释理由。
给定这条用户消息,从 search_docs、create_ticket、answer_directly 中选一个,只回复工具名。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Gemini 3.1 Flash-Lite 最适合做什么?
高并发、对延迟敏感的任务,比如提取、分类、打标签、路由和快速的多模态回答。它用一部分推理深度换来速度,每次调用的负载也更轻。
它接受图片吗?
接受。文本和图片可以混合放在一个请求里,所以它能读文档、截图和照片。回答以文本形式返回,或返回符合你 schema 的 JSON。
它能调用工具吗?
能。支持函数调用,所以它可以充当第一级智能体,为简单请求选择工具,或把难题转交给更大的模型。
它和 Gemini 3.5 Flash-Lite 有什么不同?
3.5 Flash-Lite 是更新的一代,也是 Google 现在为新项目推荐的;3.1 Flash-Lite 是较早的 Lite 模型,仍属稳定版。切换流量前,先用自己的提示词测试两者。
Gemini 3.1 Flash-Lite 的费用是多少?
在 TokenLab 上,Gemini 3.1 Flash-Lite 的价格为 输入 $0.125 / 输出 $0.75 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Gemini 3.1 Flash-Lite 的上下文窗口和输出上限是多少?
Gemini 3.1 Flash-Lite 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。
Gemini 3.1 Flash-Lite 应该使用哪个端点?
Gemini 3.1 Flash-Lite 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent。代码写法见下方的请求示例。
Gemini 3.1 Flash-Lite 支持哪些操作?
Gemini 3.1 Flash-Lite 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Gemini 3.1 Flash-Lite 对比
用到 Gemini 3.1 Flash-Lite 的指南
资料来源
审阅于 2026年10月2日