xAI: Grok 4.20
grok-4.20- 输入 / 输出-50%
- $1.25 / $2.50$0.625 / $1.25
- 上下文
- 1M
- 最大输出
- 128K
- 模态
- 视觉聊天
- 能力
- 工具调用提示词缓存推理
Grok 4.20 简介
Grok 4.20 是 xAI 4.20 系列中带推理的模型,为超长输入上的工具调用工作流而设计。它读取文本和图像,输出文本,并且先思考再回答,这是它与同系列的不推理版和多智能体版的区别。答案取决于把许多文档、截图和工具中间结果拼在一起时,选它。
擅长的任务
- 先推理再回复,多步骤问题得到的是推演后的答案,而不是第一反应。
- 接受图像和文本,一次对话里可以混用截图、图表和文字材料。
- 支持工具调用并返回结构化 JSON,可以放进智能体循环或信息抽取流水线。
- 能处理很长的对话历史,适合在多轮中不断积累证据的调查。
- 提示词缓存降低了在多个请求间重复发送大段共同前缀的成本。
什么情况换别的模型
- 思考步骤会增加延迟;任务只是普通的起草或信息抽取时,不推理的 4.20 变体回答更快。
- 4.7 等较新的 Grok 版本更直接地面向编程和智能体工作,在较难的软件任务上可能表现更好。
- 只输出文本,不能生成图像、音频或视频。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本生成Responses APIPOST/v1/responsesAPI 格式:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-4.20", "input": "Hello!" }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
输入 token <= 200K
每 1M token- 官方价格
- 输入 $1.25 / 输出 $2.50 / 缓存读取 $0.20
- TokenLab 价格
- 输入 $0.625 / 输出 $1.25 / 缓存读取 $0.10
- 折扣
- -50%
输入 token > 200K
每 1M token- 官方价格
- 输入 $2.50 / 输出 $5.00 / 缓存读取 $0.40
- TokenLab 价格
- 输入 $1.25 / 输出 $2.50 / 缓存读取 $0.20
- 折扣
- -50%
缓存读取
- 官方价格
- $0.20
- TokenLab 价格
- $0.10
- 折扣
- -50%
| 官方价格每 1M token | TokenLab 价格每 1M token | 折扣 | |
|---|---|---|---|
| 输入 token <= 200K | 输入 $1.25 / 输出 $2.50 / 缓存读取 $0.20 | 输入 $0.625 / 输出 $1.25 / 缓存读取 $0.10 | -50% |
| 输入 token > 200K | 输入 $2.50 / 输出 $5.00 / 缓存读取 $0.40 | 输入 $1.25 / 输出 $2.50 / 缓存读取 $0.20 | -50% |
| 提示词缓存价格 | |||
| 缓存读取 | $0.20 | $0.10 | -50% |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Grok 4.20 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 grok-4.20 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。
使用场景
适用场景- 推理
- 视觉
基于证据的调查
把事故或审计过程中收集的报告、导出文件和截图交给它,要求给出一份有推理依据的时间线,以及仍未解决的问题。
带工具的智能体循环
给它搜索、数据库或工单函数,让它自己决定调用哪个、读取结果,并继续直到问题得到解答。
从杂乱输入中结构化抽取
把扫描的表单、发票或聊天记录转成固定的 JSON schema,推理步骤有助于处理含糊的条目。
提示词示例
下面是三份日志导出文件和一张仪表盘截图。梳理这次故障的时间线,并标出日志中相互矛盾的地方。
把这张发票图片里的供应商、日期、明细项和税额,按下面的 schema 抽取为 JSON。对没把握的字段做标记。
你可以调用 search_orders 和 get_customer。有客户说订单 8812 少了两件商品。想一想该查什么,按什么顺序查。
此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。
FAQ
Grok 4.20 是什么?
Grok 4.20 是 xAI 的聊天模型,接受文本和图像,以文本回答。这是该系列带推理的版本:回复之前先对问题进行推演。xAI 还提供同一代的不推理版和多智能体版。
grok-4.20 和 grok-4.20-non-reasoning 有什么区别?
基础 ID 在回答前会花时间推理,不推理的 ID 直接回复。需要几步分析的问题用基础 ID,起草、信息抽取和聊天这类速度比深度更重要的场景,用不推理的。
Grok 4.20 能读图吗?
能。你可以把图像和文本一起发送,例如截图、图表或拍下来的文档,并在同一次对话中就它们提问。回复是文本;模型不生成也不编辑图像。
Grok 4.20 支持工具调用和 JSON 输出吗?
支持。它支持函数调用和结构化 JSON 响应,所以你可以把它接到自己的函数上,或把答案约束在某个 schema 内。这使它既能用于信息抽取,也能用于操作外部系统的智能体。
我现有的 OpenAI 风格客户端能用于 Grok 4.20 吗?
能。现有的 OpenAI 风格客户端代码改一下模型名即可使用,工具定义和 JSON schema 用的是你现在已经在发送的那些字段。
Grok 4.20 的费用是多少?
在 TokenLab 上,Grok 4.20 的价格为 输入 $0.625 / 输出 $1.25 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Grok 4.20 的上下文窗口和输出上限是多少?
Grok 4.20 最多接收 1,000,000 token 的上下文,单次最多返回 131,072 token。
Grok 4.20 应该使用哪个端点?
Grok 4.20 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。
Grok 4.20 支持哪些操作?
Grok 4.20 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。
Grok 4.20 对比
资料来源
审阅于 2026年10月2日