Google: Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite- 输入 / 输出-50%
- $0.30 / $2.50$0.15 / $1.25
- 上下文
- 1M
- 发布日期
- 2026年7月21日
- 最大输出
- 64K
- 模态
- 视觉聊天
- 能力
- 工具调用提示词缓存
Gemini 3.5 Flash-Lite 简介
Gemini 3.5 Flash-Lite 是 Google 3.5 这一代里最快、性价比最高的模型,2026 年 7 月发布。它针对看重短响应时间的高并发工作:文档处理、信息提取和重复的小型智能体任务。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,并缓存上下文,Google 现在推荐新项目使用它。
擅长的任务
- 为要重复成千上万次的工作而设计,响应时间短。
- 文本和图片一起处理,适合文档和截图处理。
- 受 schema 约束的 JSON,让提取输出保持一致。
- 函数调用让它能跑小型智能体步骤,比如查询或路由。
什么情况换别的模型
- 长时间编码会话和复杂的企业工作流,应该交给 3.8 Flash 或 3.1 Pro。
- 遇到内容密集或有歧义的文档,它会漏掉一些更完整的 Flash 模型能抓到的细节。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Gemini APIPOST/v1beta/models/gemini-3.5-flash-lite:generateContentAPI 格式:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
价格
TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。
默认规格
每 1M token- 官方价格
- 输入 $0.30 / 输出 $2.50 / 缓存读取 $0.03
- TokenLab 价格
- 输入 $0.15 / 输出 $1.25 / 缓存读取 $0.015
- 折扣
- -50%
缓存读取
- 官方价格
- $0.03
- TokenLab 价格
- $0.015
- 折扣
- -50%
| 官方价格每 1M token | TokenLab 价格每 1M token | 折扣 | |
|---|---|---|---|
| 默认规格 | 输入 $0.30 / 输出 $2.50 / 缓存读取 $0.03 | 输入 $0.15 / 输出 $1.25 / 缓存读取 $0.015 | -50% |
| 提示词缓存价格 | |||
| 缓存读取 | $0.03 | $0.015 | -50% |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
- 30 天成功率
- 99.7%
- 7 天中位延迟
- 1.9 sn=346
- 7 天 P95 延迟
- 7 sn=346
- 30 天请求数
- 100+
- 最后活动时间
- 19小时前
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Gemini 3.5 Flash-Lite 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 gemini-3.5-flash-lite 发一条简短消息,接口是 /v1beta/models/gemini-3.5-flash-lite:generateContent。返回回复,附上延迟和费用。
使用场景
适用场景- 视觉
文档流水线
大规模把合同、发票和报告转成结构化字段,每个传入文件写出一条经过校验的 JSON 记录。
队列分诊
在人工或更大的模型看到之前,按主题和紧急程度对工单或消息排序。
小型智能体
运行范围窄的工具循环任务,比如查订单或改日程,每一步都很小,循环却很频繁。
视觉检查
确认上传的照片符合简单规则,比如标签清晰可见,或方向正确。
提示词示例
把这张发票的每个明细行提取为 JSON,包含描述、数量和单价。
把这张工单的紧急程度评为 low、medium 或 high,并给出唯一一句理由。
检查这张商品照片是否清楚地显示了包装标签;回答是或否,并说明原因。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Gemini 3.5 Flash-Lite 适合做什么?
快速、重复、简单的工作:提取、分类、路由和轻量的多模态检查。它是 3.5 系列里经济的一档,为响应时间而不是深度而设计。
它比 Gemini 3.1 Flash-Lite 新吗?
是。它是更晚的一代,Google 把它列为新项目推荐的轻量选择。较早的 3.1 Flash-Lite 仍可用于现有集成。
它能读图片吗?
能。请求里可以在文本之外附上图片,回答以纯文本或结构化 JSON 返回,适合照片检查和扫描文档提取。
什么情况下它就太小了?
任务需要持续推理、仔细分析长文档,或长达数小时的编码工作时。这些情况请升级到 Gemini 3.8 Flash 或 3.1 Pro。
Gemini 3.5 Flash-Lite 的费用是多少?
在 TokenLab 上,Gemini 3.5 Flash-Lite 的价格为 输入 $0.15 / 输出 $1.25 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Gemini 3.5 Flash-Lite 的上下文窗口和输出上限是多少?
Gemini 3.5 Flash-Lite 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。
Gemini 3.5 Flash-Lite 应该使用哪个端点?
Gemini 3.5 Flash-Lite 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent。代码写法见下方的请求示例。
Gemini 3.5 Flash-Lite 支持哪些操作?
Gemini 3.5 Flash-Lite 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Gemini 3.5 Flash-Lite 对比
资料来源
审阅于 2026年10月2日