Google: Gemma 4 31B
gemma-4-31b- 输入 / 输出
- $0.102 / $0.297
- 模态
- 聊天
Gemma 4 31B 简介
Gemma 4 31B 是 Google 开放权重 Gemma 4 系列中最大的稠密模型。该系列于 2026 年 3 月发布,规格从 E2B 到 31B。Google 称这个系列面向推理、智能体工作流、编码和多模态理解。与闭源的 Gemini 模型不同,它的权重是公开的,所以同一个模型也可以在你自己的硬件上运行。
擅长的任务
- 开放权重让你可以在托管和自行部署之间迁移同一个模型。
- 31B 稠密规模面向较小的 Gemma 4 规格做不到的推理和编码质量。
- Google 的模型卡称其在 MMLU Pro 和 LiveCodeBench v6 等推理与编码评测上成绩出色。
- 支持超过 140 种语言。
什么情况换别的模型
- 只支持文本,没有工具调用,所以智能体工作流更适合用 Gemini 模型。
- 在长时间自主任务上,能力不如 Gemini 3.x Pro 和 Flash 模型。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Chat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "gemma-4-31b", "messages": [ {"role": "user", "content": "Hello!"} ] }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
默认规格
每 1M token- 官方价格
- 输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012
- Official
- 输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012
- 折扣
- —
缓存读取
- 官方价格
- $0.012
- Official
- $0.012
- 折扣
- —
| 官方价格每 1M token | Official每 1M token | 折扣 | |
|---|---|---|---|
| 默认规格 | 输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012 | 输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012 | — |
| 提示词缓存价格 | |||
| 缓存读取 | $0.012 | $0.012 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Gemma 4 31B 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 gemma-4-31b 发一条简短消息,接口是 /v1/chat/completions。返回回复,附上延迟和费用。
使用场景
可自行部署的助手
先用托管模型做原型,如果数据合规要求,再迁移到自己的 GPU 上。
多语言对话
用一个模型回答多种语言的用户,比单独运行翻译器更省事,客服工具也更简单。
代码讲解
在因政策或部署原因必须使用开放权重模型的环境里,审查代码片段并编写函数。
微调基座
先拿托管版本做基线对比,再把开放权重适配到自己的领域。
提示词示例
把这段话翻译成西班牙语、德语和日语,并说明哪些习语你改写了。
解释这条 SQL 查询是做什么的,然后改写它,避免使用相关子查询。
写一封简短、礼貌的回复,拒绝这个会议邀请,并建议下周再约。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Gemma 4 31B 是开源的吗?
Google 按 Gemma 条款发布权重,所以它是开放权重模型。商用前请先阅读模型卡上的许可证,因为这是 Gemma 自己的许可证。
Gemma 和 Gemini 有什么区别?
Gemini 是 Google 的托管闭源系列。Gemma 是基于相关研究做出的较小的开放权重模型,可以下载、微调并自行运行。
它支持工具调用吗?
不支持。托管版本只做文本对话,输入输出都是文本,没有工具调用。需要调用函数的智能体,请改用 Gemini 模型。
这个模型有多大?
约 310 亿参数,稠密结构,是五个 Gemma 4 规格(E2B、E4B、12B、26B A4B 和 31B)中最大的。较小的规格面向手机和笔记本。
Gemma 4 31B 的费用是多少?
在 TokenLab 上,Gemma 4 31B 的价格为 输入 $0.102 / 输出 $0.297 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Gemma 4 31B 应该使用哪个端点?
Gemma 4 31B 使用 https://api.tokenlab.sh/v1/chat/completions。代码写法见下方的请求示例。
Gemma 4 31B 支持哪些操作?
Gemma 4 31B 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Gemma 4 31B 对比
资料来源
审阅于 2026年10月2日