每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Google: Gemma 4 31B

Gemma 4 31B 是 Google 的稠密开放权重模型,适用于文本对话、编程和多语言任务。TokenLab 为该模型提供已验证的文本 Chat Completions 接口。
对比模型
gemma-4-31b
可用Google聊天
输入 / 输出
$0.102 / $0.297
模态
聊天

Gemma 4 31B 简介

Gemma 4 31B 是 Google 开放权重 Gemma 4 系列中最大的稠密模型。该系列于 2026 年 3 月发布,规格从 E2B 到 31B。Google 称这个系列面向推理、智能体工作流、编码和多模态理解。与闭源的 Gemini 模型不同,它的权重是公开的,所以同一个模型也可以在你自己的硬件上运行。

擅长的任务

  • 开放权重让你可以在托管和自行部署之间迁移同一个模型。
  • 31B 稠密规模面向较小的 Gemma 4 规格做不到的推理和编码质量。
  • Google 的模型卡称其在 MMLU Pro 和 LiveCodeBench v6 等推理与编码评测上成绩出色。
  • 支持超过 140 种语言。

什么情况换别的模型

  • 只支持文本,没有工具调用,所以智能体工作流更适合用 Gemini 模型。
  • 在长时间自主任务上,能力不如 Gemini 3.x Pro 和 Flash 模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Chat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "gemma-4-31b",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

默认规格

每 1M token
官方价格
输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012
Official
输入 $0.102 / 输出 $0.297 / 缓存读取 $0.012
折扣
—
提示词缓存价格

缓存读取

官方价格
$0.012
Official
$0.012
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Gemma 4 31B 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 gemma-4-31b 发一条简短消息,接口是 /v1/chat/completions。返回回复,附上延迟和费用。

使用场景

  • 可自行部署的助手

    先用托管模型做原型,如果数据合规要求,再迁移到自己的 GPU 上。

  • 多语言对话

    用一个模型回答多种语言的用户,比单独运行翻译器更省事,客服工具也更简单。

  • 代码讲解

    在因政策或部署原因必须使用开放权重模型的环境里,审查代码片段并编写函数。

  • 微调基座

    先拿托管版本做基线对比,再把开放权重适配到自己的领域。

提示词示例

把这段话翻译成西班牙语、德语和日语,并说明哪些习语你改写了。

解释这条 SQL 查询是做什么的,然后改写它,避免使用相关子查询。

写一封简短、礼貌的回复,拒绝这个会议邀请,并建议下周再约。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

Gemma 4 31B 是开源的吗?

Google 按 Gemma 条款发布权重,所以它是开放权重模型。商用前请先阅读模型卡上的许可证,因为这是 Gemma 自己的许可证。

Gemma 和 Gemini 有什么区别?

Gemini 是 Google 的托管闭源系列。Gemma 是基于相关研究做出的较小的开放权重模型,可以下载、微调并自行运行。

它支持工具调用吗?

不支持。托管版本只做文本对话,输入输出都是文本,没有工具调用。需要调用函数的智能体,请改用 Gemini 模型。

这个模型有多大?

约 310 亿参数,稠密结构,是五个 Gemma 4 规格(E2B、E4B、12B、26B A4B 和 31B)中最大的。较小的规格面向手机和笔记本。

Gemma 4 31B 的费用是多少?

在 TokenLab 上,Gemma 4 31B 的价格为 输入 $0.102 / 输出 $0.297 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Gemma 4 31B 应该使用哪个端点?

Gemma 4 31B 使用 https://api.tokenlab.sh/v1/chat/completions。代码写法见下方的请求示例。

Gemma 4 31B 支持哪些操作?

Gemma 4 31B 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

Gemma 4 31B 对比

资料来源

审阅于 2026年10月2日

相关模型