音频模型

处理语音、音乐和音频的 AI 模型

音频 · OpenAI

gpt-realtime-2.1
可用
提示词缓存工具调用视觉缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$4.00输出$24.00/1M
gpt-realtime-2.1-mini
可用
提示词缓存工具调用视觉缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$0.60输出$2.40/1M
gpt-realtime-1.5
可用
提示词缓存工具调用缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$4.00输出$16.00/1M
gpt-realtime-2
可用
提示词缓存工具调用缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$4.00输出$24.00/1M
gpt-4o-mini-transcribe
可用
快速语音转文本缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$1.25输出$5.00/1M
gpt-4o-transcribe
可用
语音转文本缓存输入便宜
TokenLab 价格— 折扣
—
官方价格
输入$2.50输出$10.00/1M
gpt-4o-mini-tts
可用
文本转语音
TokenLab 价格— 折扣
—
官方价格
输入$0.60输出$12.00/1M
gpt-4o-transcribe-diarize
可用
语音转文本
TokenLab 价格— 折扣
—
官方价格
输入$2.50输出$10.00/1M
gpt-live-transcribe
可用
语音转文本
TokenLab 价格— 折扣
—
官方价格
$0.0002833/秒
gpt-transcribe
可用
语音转文本
TokenLab 价格— 折扣
—
官方价格
$0.000075/秒
tts-1
可用
文本转语音
TokenLab 价格— 折扣
—
官方价格
输入$15.00输出$0.00/百万字符
tts-1-hd
可用
文本转语音
TokenLab 价格— 折扣
—
官方价格
输入$30.00输出$0.00/百万字符
whisper-1
可用
语音转文本
TokenLab 价格/ 官方价格— 折扣
—
whisper-large-v3
可用
语音转文本
TokenLab 价格— 折扣
—
官方价格
$0.00003083/秒
whisper-large-v3-turbo
可用
快速语音转文本
TokenLab 价格— 折扣
—
官方价格
$0.00001111/秒

全部模型系列

5 个系列

音频模型怎么选

真正合适的模型,要同时满足任务、质量、速度和预算。

选择信号

  • 按你实际需要的输入和输出去挑模型。
  • 只有计价单位相同的模型才适合直接比较。
  • 小规模测试能发现目录里看不到的质量和延迟差异。

FAQ

好的音频模型要看什么?

合适的模型要匹配任务、质量要求、延迟目标和预算。小规模评测能更直观地发现质量和稳定性差异。

之后还能换模型吗?

可以。公开模型 ID 和请求格式保持明确,同组任务对比即可。