- 输入 / 输出
- $0.30 / $1.20
- 上下文
- 1M
- 最大输出
- 512K
- 模态
- 聊天
- 能力
- 工具调用提示词缓存
MiniMax-M3 简介
MiniMax-M3 是 MiniMax 在 2026 年 6 月发布的开放权重模型,面向编程、智能体工作和长上下文任务。它使用 MiniMax Sparse Attention,让很长的输入也负担得起,回答前先推理,能调用工具,支持提示词缓存。它是该公司 M 系列的前沿模型,也是 M2.7 的后继者。
擅长的任务
- MiniMax Sparse Attention 相比上一代,降低了超长输入下每个 token 的计算量。
- 面向智能体的自主任务拆解、工具调用和多步骤推理。
- MiniMax 公开发布了开放权重,可以拿自行部署的副本来核对行为。
- 推理、工具调用和提示词缓存都可以开启,用于长的智能体循环。
什么情况换别的模型
- 仅支持文本输入,无法直接读取图表和截图。
- 推理加上很长的输入,使请求比 highspeed 的 M2.x 模型更慢。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Responses APIPOST/v1/responsesAPI 格式:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "minimax-m3", "input": "Hello!" }'
价格
Verified 价格用于 Verified,多数模型更便宜;Official 价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。
输入 token <= 512K
每 1M token- Official 价格
- 输入 $0.30 / 输出 $1.20 / 缓存读取 $0.06
- Verified 价格
- —
- 折扣
- —
输入 token > 512K
每 1M token- Official 价格
- 输入 $0.60 / 输出 $2.40 / 缓存读取 $0.12
- Verified 价格
- —
- 折扣
- —
缓存读取
- Official 价格
- $0.06
- Verified 价格
- —
- 折扣
- —
| Official 价格每 1M token | Verified 价格每 1M token | 折扣 | |
|---|---|---|---|
| 输入 token <= 512K | 输入 $0.30 / 输出 $1.20 / 缓存读取 $0.06 | — | — |
| 输入 token > 512K | 输入 $0.60 / 输出 $2.40 / 缓存读取 $0.12 | — | — |
| 提示词缓存价格 | |||
| 缓存读取 | $0.06 | — | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
- 30 天成功率
- 100.0%
- 30 天请求数
- 100+
- 最后活动时间
- 前天
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
MiniMax-M3 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 minimax-m3 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。
使用场景
整个仓库级别的工作
载入一个大型代码库,让模型在修改之前跨模块追踪一次改动的影响。
规划型智能体
给智能体一组工具和一个目标,让它拆解任务并一步步调用工具。
长文档分析
一次性审阅很长的会议记录、规格说明或申报文件,而不是切块处理。
提示词示例
这是完整的仓库。重试逻辑实现在哪里?如果我改了它的退避策略,会有什么问题?
这是事故时间线和服务日志。写出复现这个缺陷的步骤,并指出可能出错的模块。
规划如何把这个单体应用拆成三个服务,并说出你会为每个服务最先发起的工具调用。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
MiniMax-M3 和 M2.7 有什么不同?
MiniMax 将 M3 介绍为围绕稀疏注意力构建、面向超长上下文的新一代,针对编程和智能体任务;而 M2.7 面向较早的智能体框架。
MiniMax-M3 是开放权重的吗?
MiniMax 以开放权重的形式发布了 M3,所以如果你的数据规定要求,可以自行部署。部署之前请先阅读模型卡上的许可证。
它接受图片和视频吗?
不接受。MiniMax-M3 只接受文本输入,需要直接读取截图、图表、示意图或视频帧时,请用支持图片输入的模型。
它能使用工具吗?
能。它会调用工具,MiniMax 把它定位于智能体规划:把任务拆成多个步骤,并在每一步调用工具。请求时传入你的工具定义,由模型决定何时调用。
什么时候该用 M3 而不是 highspeed 的 M2.x 模型?
输入很长,或智能体规划更难时选 M3。每一轮的延迟比推理深度更重要时,选 highspeed 的 M2.x 版本。
MiniMax-M3 的费用是多少?
在 TokenLab 上,MiniMax-M3 的价格为 输入 $0.30 / 输出 $1.20 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
MiniMax-M3 的上下文窗口和输出上限是多少?
MiniMax-M3 最多接收 1,048,576 token 的上下文,单次最多返回 524,288 token。
MiniMax-M3 应该使用哪个端点?
MiniMax-M3 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。
MiniMax-M3 支持哪些操作?
MiniMax-M3 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
MiniMax-M3 对比
资料来源
审阅于 2026年10月2日