Google: Gemini 3.5 Flash
gemini-3.5-flash- 输入 / 输出-50%
- $1.50 / $9.00$0.75 / $4.50
- 上下文
- 1M
- 发布日期
- 2026年5月19日
- 最大输出
- 64K
- 模态
- 视觉聊天
- 能力
- 工具调用提示词缓存推理
Gemini 3.5 Flash 简介
Gemini 3.5 Flash 是 Google 的稳定版 Flash 档模型,Google 称它是日常高吞吐工作负载中速度和基础性能的基准。它能读文本和图片,调用工具,返回受 schema 约束的 JSON,并支持缓存。它的位置介于 Flash-Lite 3.5 与之后的 3.6、3.7、3.8 Flash 版本之间。
擅长的任务
- 稳定的通用 Flash 模型,适合大批量的日常对话、提取和摘要。
- 工具调用能支持完成几步任务的助手。
- 支持图片输入,处理截图、扫描件和图表时不需要单独的视觉模型。
- 受 schema 约束的 JSON 和上下文缓存,适合反复调用的流水线。
什么情况换别的模型
- 后来的 3.6、3.7 和 3.8 Flash 模型在编码和智能体任务上更强。
- 它没有专门的思考模式,较难的多步推理最好交给别的模型。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Gemini APIPOST/v1beta/models/gemini-3.5-flash:generateContentAPI 格式:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
价格
Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。
默认规格
每 1M token- Official 价格
- 输入 $1.50 / 输出 $9.00 / 缓存读取 $0.15
- Verified 价格
- 输入 $0.75 / 输出 $4.50 / 缓存读取 $0.075
- 折扣
- -50%
缓存读取
- Official 价格
- $0.15
- Verified 价格
- $0.075
- 折扣
- -50%
按次计费,仅在模型实际使用工具时收取。
网页搜索
- Official 价格
- $0.014/次搜索
- Verified 价格
- $0.007/次搜索
- 折扣
- -50%
| Official 价格每 1M token | Verified 价格每 1M token | 折扣 | |
|---|---|---|---|
| 默认规格 | 输入 $1.50 / 输出 $9.00 / 缓存读取 $0.15 | 输入 $0.75 / 输出 $4.50 / 缓存读取 $0.075 | -50% |
| 提示词缓存价格 | |||
| 缓存读取 | $0.15 | $0.075 | -50% |
| 工具附加费按次计费,仅在模型实际使用工具时收取。 | |||
| 网页搜索 | $0.014/次搜索 | $0.007/次搜索 | -50% |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
- 30 天成功率
- 95.0%
- 30 天请求数
- 1K+
- 最后活动时间
- 1小时前
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Gemini 3.5 Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 gemini-3.5-flash 发一条简短消息,接口是 /v1beta/models/gemini-3.5-flash:generateContent。返回回复,附上延迟和费用。
使用场景
适用场景- 推理
- 视觉
面向客户的对话
把缓存的知识库放在提示词前缀里,回答产品问题。
批量摘要
总结通话转写稿或工单,为每一项输出固定格式的 JSON 摘要。
表单和文档阅读
从扫描的表单和送货单中取出字段,整理成下游系统可直接导入的结构化记录。
入门级编码辅助
讲解代码、写小函数、起草单元测试,这些场景对深度要求不高。
提示词示例
用三个要点总结这份客服转写稿,并把 resolved 设为 true 或 false。
读取这张扫描的送货单,以 JSON 返回订单号、商品和签收状态。
写一个 Python 函数,从杂乱的字符串里解析 ISO 日期,再附上五个测试用例。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Gemini 3.5 Flash 是什么?
一个稳定的 Flash 档 Gemini 模型,面向日常高吞吐任务。它接受文本和图片,能使用工具,并生成结构化输出,侧重稳定的速度而不是最大深度。
它和 Gemini 3.5 Flash-Lite 比起来怎么样?
Flash-Lite 是 Google 最快、最经济的 3.5 模型;Flash 是更完整的模型,用于需要更仔细处理的任务。打标签和提取选 Lite,对话和较长输出选 Flash。
适合做编码智能体吗?
它能处理小型编码任务,但 Google 面向复杂编码和长时程智能体的,是后来的 3.7 和 3.8 Flash 模型。任务简单、量很大时,才用 3.5 Flash。
它支持图片和缓存吗?
两者都支持。请求里可以在文本旁带上图片,上下文缓存则能在大量请求间复用较长的共享前缀,比如固定的一套指令。
Gemini 3.5 Flash 的费用是多少?
在 TokenLab 上,Gemini 3.5 Flash 的价格为 输入 $0.75 / 输出 $4.50 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Gemini 3.5 Flash 的上下文窗口和输出上限是多少?
Gemini 3.5 Flash 最多接收 1,048,576 token 的上下文,单次最多返回 65,536 token。
Gemini 3.5 Flash 应该使用哪个端点?
Gemini 3.5 Flash 使用 https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent。代码写法见下方的请求示例。
Gemini 3.5 Flash 支持哪些操作?
Gemini 3.5 Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Gemini 3.5 Flash 对比
用到 Gemini 3.5 Flash 的指南
资料来源
审阅于 2026年10月2日