Audio Models

AI models for speech, music, and audio processing

Audio · OpenAI

gpt-realtime-2.1
Available
Prompt CacheTool useVisionCached inputless
TokenLab price— Discount
—
Official price
Input$4.00Output$24.00/1M
gpt-realtime-2.1-mini
Available
Prompt CacheTool useVisionCached inputless
TokenLab price— Discount
—
Official price
Input$0.60Output$2.40/1M
gpt-realtime-1.5
Available
Prompt CacheTool useCached inputless
TokenLab price— Discount
—
Official price
Input$4.00Output$16.00/1M
gpt-realtime-2
Available
Prompt CacheTool useCached inputless
TokenLab price— Discount
—
Official price
Input$4.00Output$24.00/1M
gpt-4o-mini-transcribe
Available
FastSpeech to TextCached inputless
TokenLab price— Discount
—
Official price
Input$1.25Output$5.00/1M
gpt-4o-transcribe
Available
Speech to TextCached inputless
TokenLab price— Discount
—
Official price
Input$2.50Output$10.00/1M
gpt-4o-mini-tts
Available
Text to speech
TokenLab price— Discount
—
Official price
Input$0.60Output$12.00/1M
gpt-4o-transcribe-diarize
Available
Speech to Text
TokenLab price— Discount
—
Official price
Input$2.50Output$10.00/1M
gpt-live-transcribe
Available
Speech to Text
TokenLab price— Discount
—
Official price
$0.0002833/sec
gpt-transcribe
Available
Speech to Text
TokenLab price— Discount
—
Official price
$0.000075/sec
tts-1
Available
Text to speech
TokenLab price— Discount
—
Official price
Input$15.00Output$0.00/1M characters
tts-1-hd
Available
Text to speech
TokenLab price— Discount
—
Official price
Input$30.00Output$0.00/1M characters
whisper-1
Available
Speech to Text
TokenLab price/ Official price— Discount
—
whisper-large-v3
Available
Speech to Text
TokenLab price— Discount
—
Official price
$0.00003083/sec
whisper-large-v3-turbo
Available
FastSpeech to Text
TokenLab price— Discount
—
Official price
$0.00001111/sec

All model series

5 series

Choosing the right audio model

The right model balances task fit, output quality, latency, and price.

Selection signals

  • Match the model to the input and output you actually need.
  • Compare models that use the same pricing unit.
  • A small test reveals quality and latency differences that a catalog cannot.

FAQ

What makes a good audio model?

A strong fit matches the task, quality bar, latency target, and budget. A small evaluation set makes quality and reliability differences easier to see.

Can I switch models later?

Yes. Keep the public model ID and request format explicit, and compare alternatives on the same tasks.