每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Google: Gemini 3.5 Flash

Gemini 3.5 Flash 面向持续编程和智能体任务,长上下文与工具调用适合需要保留文档、代码及先前决策,连续完成多个步骤的助手。
对比模型
gemini-3.5-flash
可用Google聊天缓存输入便宜 90%
输入 / 输出-50%
$1.50 / $9.00$0.75 / $4.50
上下文
1M
发布日期
2026年5月19日
最大输出
64K
模态
视觉聊天
能力
工具调用提示词缓存推理

Gemini 3.5 Flash 简介

Gemini 3.5 Flash 是 Google 的稳定版 Flash 档模型,Google 称它是日常高吞吐工作负载中速度和基础性能的基准。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,并支持缓存。它的位置介于 Flash-Lite 3.5 与之后的 3.6、3.7、3.8 Flash 版本之间。

擅长的任务

  • 稳定的通用 Flash 模型,适合大批量的日常对话、提取和摘要。
  • 工具调用能支持完成几步任务的助手。
  • 支持图片输入,处理截图、扫描件和图表时不需要单独的视觉模型。
  • 受 schema 约束的 JSON 和上下文缓存,适合反复调用的流水线。

什么情况换别的模型

  • 后来的 3.6、3.7 和 3.8 Flash 模型在编码和智能体任务上更强。
  • 它没有专门的思考模式,较难的多步推理最好交给别的模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Gemini API
    POST/v1beta/models/gemini-3.5-flash:generateContent
    API 格式:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

价格

Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

默认规格

每 1M token
Official 价格
输入 $1.50 / 输出 $9.00 / 缓存读取 $0.15
Verified 价格
输入 $0.75 / 输出 $4.50 / 缓存读取 $0.075
折扣
-50%
提示词缓存价格

缓存读取

Official 价格
$0.15
Verified 价格
$0.075
折扣
-50%
工具附加费

按次计费,仅在模型实际使用工具时收取。

网页搜索

Official 价格
$0.014/次搜索
Verified 价格
$0.007/次搜索
折扣
-50%

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
30 天成功率
95.0%
30 天请求数
1K+
最后活动时间
1小时前

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Gemini 3.5 Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 gemini-3.5-flash 发一条简短消息,接口是 /v1beta/models/gemini-3.5-flash:generateContent。返回回复,附上延迟和费用。

使用场景

适用场景
  • 推理
  • 视觉
  • 面向客户的对话

    把缓存的知识库放在提示词前缀里,回答产品问题。

  • 批量摘要

    总结通话转写稿或工单,为每一项输出固定格式的 JSON 摘要。

  • 表单和文档阅读

    从扫描的表单和送货单中取出字段,整理成下游系统可直接导入的结构化记录。

  • 入门级编码辅助

    讲解代码、写小函数、起草单元测试,这些场景对深度要求不高。

提示词示例

用三个要点总结这份客服转写稿,并把 resolved 设为 true 或 false。

读取这张扫描的送货单,以 JSON 返回订单号、商品和签收状态。

写一个 Python 函数,从杂乱的字符串里解析 ISO 日期,再附上五个测试用例。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Gemini 3.5 Flash 是什么?

一个稳定的 Flash 档 Gemini 模型,面向日常高吞吐任务。它接受文本和图片,能使用工具,并生成结构化输出,侧重稳定的速度而不是最大深度。

它和 Gemini 3.5 Flash-Lite 比起来怎么样?

Flash-Lite 是 Google 最快、最经济的 3.5 模型;Flash 是更完整的模型,用于需要更仔细处理的任务。打标签和提取选 Lite,对话和较长输出选 Flash。

适合做编码智能体吗?

它能处理小型编码任务,但 Google 面向复杂编码和长时程智能体的,是后来的 3.7 和 3.8 Flash 模型。任务简单、量很大时,才用 3.5 Flash。

它支持图片和缓存吗?

两者都支持。请求里可以在文本旁带上图片,上下文缓存则能在大量请求间复用较长的共享前缀,比如固定的一套指令。

Gemini 3.5 Flash 的费用是多少?

在 TokenLab 上,Gemini 3.5 Flash 的价格为 输入 $0.75 / 输出 $4.50 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Gemini 3.5 Flash 的上下文窗口和输出上限是多少?

Gemini 3.5 Flash 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。

Gemini 3.5 Flash 应该使用哪个端点?

Gemini 3.5 Flash 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent。代码写法见下方的请求示例。

Gemini 3.5 Flash 支持哪些操作?

Gemini 3.5 Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Gemini 3.5 Flash 对比

用到 Gemini 3.5 Flash 的指南

资料来源

审阅于 2026年10月2日

更多 Gemini 3 模型

相关模型