每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Google: Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite 面向高频、低延迟任务,适合文档处理、信息抽取,以及需要反复执行的小型智能体任务,可处理文字与视觉输入。
对比模型
gemini-3.5-flash-lite
可用Google聊天缓存输入便宜 90%
输入 / 输出-50%
$0.30 / $2.50$0.15 / $1.25
上下文
1M
发布日期
2026年7月21日
最大输出
64K
模态
视觉聊天
能力
工具调用提示词缓存

Gemini 3.5 Flash-Lite 简介

Gemini 3.5 Flash-Lite 是 Google 3.5 这一代里最快、性价比最高的模型,2026 年 7 月发布。它针对看重短响应时间的高并发工作:文档处理、信息提取和重复的小型智能体任务。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,并缓存上下文,Google 现在推荐新项目使用它。

擅长的任务

  • 为要重复成千上万次的工作而设计,响应时间短。
  • 文本和图片一起处理,适合文档和截图处理。
  • 受 schema 约束的 JSON,让提取输出保持一致。
  • 函数调用让它能跑小型智能体步骤,比如查询或路由。

什么情况换别的模型

  • 长时间编码会话和复杂的企业工作流,应该交给 3.8 Flash 或 3.1 Pro。
  • 遇到内容密集或有歧义的文档,它会漏掉一些更完整的 Flash 模型能抓到的细节。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Gemini API
    POST/v1beta/models/gemini-3.5-flash-lite:generateContent
    API 格式:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

价格

TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

默认规格

每 1M token
官方价格
输入 $0.30 / 输出 $2.50 / 缓存读取 $0.03
TokenLab 价格
输入 $0.15 / 输出 $1.25 / 缓存读取 $0.015
折扣
-50%
提示词缓存价格

缓存读取

官方价格
$0.03
TokenLab 价格
$0.015
折扣
-50%

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
30 天成功率
99.7%
7 天中位延迟
1.9 sn=346
7 天 P95 延迟
7 sn=346
30 天请求数
100+
最后活动时间
19小时前

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Gemini 3.5 Flash-Lite 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 gemini-3.5-flash-lite 发一条简短消息,接口是 /v1beta/models/gemini-3.5-flash-lite:generateContent。返回回复,附上延迟和费用。

使用场景

适用场景
  • 视觉
  • 文档流水线

    大规模把合同、发票和报告转成结构化字段,每个传入文件写出一条经过校验的 JSON 记录。

  • 队列分诊

    在人工或更大的模型看到之前,按主题和紧急程度对工单或消息排序。

  • 小型智能体

    运行范围窄的工具循环任务,比如查订单或改日程,每一步都很小,循环却很频繁。

  • 视觉检查

    确认上传的照片符合简单规则,比如标签清晰可见,或方向正确。

提示词示例

把这张发票的每个明细行提取为 JSON,包含描述、数量和单价。

把这张工单的紧急程度评为 low、medium 或 high,并给出唯一一句理由。

检查这张商品照片是否清楚地显示了包装标签;回答是或否,并说明原因。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Gemini 3.5 Flash-Lite 适合做什么?

快速、重复、简单的工作:提取、分类、路由和轻量的多模态检查。它是 3.5 系列里经济的一档,为响应时间而不是深度而设计。

它比 Gemini 3.1 Flash-Lite 新吗?

是。它是更晚的一代,Google 把它列为新项目推荐的轻量选择。较早的 3.1 Flash-Lite 仍可用于现有集成。

它能读图片吗?

能。请求里可以在文本之外附上图片,回答以纯文本或结构化 JSON 返回,适合照片检查和扫描文档提取。

什么情况下它就太小了?

任务需要持续推理、仔细分析长文档,或长达数小时的编码工作时。这些情况请升级到 Gemini 3.8 Flash 或 3.1 Pro。

Gemini 3.5 Flash-Lite 的费用是多少?

在 TokenLab 上,Gemini 3.5 Flash-Lite 的价格为 输入 $0.15 / 输出 $1.25 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Gemini 3.5 Flash-Lite 的上下文窗口和输出上限是多少?

Gemini 3.5 Flash-Lite 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。

Gemini 3.5 Flash-Lite 应该使用哪个端点?

Gemini 3.5 Flash-Lite 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent。代码写法见下方的请求示例。

Gemini 3.5 Flash-Lite 支持哪些操作?

Gemini 3.5 Flash-Lite 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Gemini 3.5 Flash-Lite 对比

资料来源

审阅于 2026年10月2日

更多 Gemini 3 模型

相关模型