Audio y tiempo real
Crear voz
Genera audio a partir del texto de entrada
Cuerpo de la solicitud
El modo de respuesta depende del modelo elegido y de stream_format. Para entradas largas, permite un tiempo de espera HTTP de al menos 120s.
Los campos opcionales, voces, formatos y compatibilidad con SSE dependen del modelo. Consulta GET /v1/models/{model} antes de enviarlos. Los parámetros no admitidos pueden devolver 400 unsupported_parameter.
tts-1ID del modelo TTS. Consulta las opciones actuales con GET /v1/models?recommended_for=tts.
El texto para el que se generará audio. Máximo 4096 caracteres.
Selector de voz. Pasa un nombre integrado como nova, una voz de Gemini como Kore o un objeto como { "id": "voice-id" } para voces personalizadas compatibles.
ID de voz para modelos compatibles con este parámetro, como los modelos de voz MiniMax compatibles.
Instrucciones opcionales de estilo o entrega para modelos TTS compatibles con OpenAI que las admitan.
Prompt opcional de estilo de habla para modelos Gemini TTS.
Código de idioma opcional, por ejemplo en-US, para rutas Gemini, xAI y TTS compatibles.
Formato de audio. Valores comunes: mp3, opus, aac, flac, wav y pcm; los valores admitidos varían según la familia de modelo.
audioFormato de entrega de TokenLab: audio o sse. stream_format=sse no está admitido para tts-1 ni tts-1-hd.
Velocidad del habla para familias de modelos que la admitan (0.25 a 4.0).
Temperatura de muestreo para rutas TTS compatibles con Gemini (0 a 2).
Respuesta
stream_format=audio devuelve bytes de audio. Los modelos compatibles con stream_format=sse devuelven text/event-stream; procesa sus eventos en lugar de guardar toda la respuesta como archivo de audio.
Solicitud
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3Muestras de voz
Las voces disponibles dependen del modelo. Los nombres siguientes son ejemplos, no una lista común para todos los modelos TTS.
| Voz | Descripción |
|---|---|
alloy | Neutral, equilibrada |
ash | Tranquila, medida |
ballad | Melódica, expresiva |
coral | Cálida, acogedora |
echo | Cálida, conversacional |
fable | Expresiva, narrativa |
nova | Amigable, clara |
onyx | Profunda, autoritaria |
sage | Sabia, reflexiva |
shimmer | Suave, delicada |
verse | Dinámica, versátil |
Respuesta
<binary audio data>Campos importantes
Tipo de medio de la respuesta HTTP: formato de audio o text/event-stream para SSE.
Bytes de audio con audio; flujo de eventos con sse. Elige el procesamiento según Content-Type y el modo solicitado.
MiniMax Speech 2.8 Turbo sintetiza un guion con una voz seleccionada mediante un flujo centrado en la velocidad. Es útil para interfaces de voz con respuesta rápida y narración.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}Autorización
BearerAuth Autenticación con API Key. Cree o gestione API keys en Dashboard > API > API Keys.
Ubicación: header
Encabezados
Política de entrega por solicitud. Sustituye los valores predeterminados de la API key y del Workspace. Auto intenta primero con TokenLab Verified y puede cambiar una vez a Official solo antes de la salida, la aceptación de la solicitud o la creación de recursos persistentes.
Valores permitidos
- "auto"
- "verified"
- "official"
Cuerpo de la solicitud
application/json
Respuesta
application/json
application/json
application/json
application/json
application/json
application/json