Audio y tiempo real

Crear voz

Genera audio a partir del texto de entrada

POST
/v1/audio/speech

Cuerpo de la solicitud

El modo de respuesta depende del modelo elegido y de stream_format. Para entradas largas, permite un tiempo de espera HTTP de al menos 120s.

Los campos opcionales, voces, formatos y compatibilidad con SSE dependen del modelo. Consulta GET /v1/models/{model} antes de enviarlos. Los parámetros no admitidos pueden devolver 400 unsupported_parameter.

modelstringpredeterminado: tts-1

ID del modelo TTS. Consulta las opciones actuales con GET /v1/models?recommended_for=tts.

inputstringobligatorio

El texto para el que se generará audio. Máximo 4096 caracteres.

voicestring | object

Selector de voz. Pasa un nombre integrado como nova, una voz de Gemini como Kore o un objeto como { "id": "voice-id" } para voces personalizadas compatibles.

voice_idstring

ID de voz para modelos compatibles con este parámetro, como los modelos de voz MiniMax compatibles.

instructionsstring

Instrucciones opcionales de estilo o entrega para modelos TTS compatibles con OpenAI que las admitan.

promptstring

Prompt opcional de estilo de habla para modelos Gemini TTS.

language_codestring

Código de idioma opcional, por ejemplo en-US, para rutas Gemini, xAI y TTS compatibles.

response_formatstring

Formato de audio. Valores comunes: mp3, opus, aac, flac, wav y pcm; los valores admitidos varían según la familia de modelo.

stream_formatstringpredeterminado: audio

Formato de entrega de TokenLab: audio o sse. stream_format=sse no está admitido para tts-1 ni tts-1-hd.

speednumber

Velocidad del habla para familias de modelos que la admitan (0.25 a 4.0).

temperaturenumber

Temperatura de muestreo para rutas TTS compatibles con Gemini (0 a 2).

Respuesta

stream_format=audio devuelve bytes de audio. Los modelos compatibles con stream_format=sse devuelven text/event-stream; procesa sus eventos en lugar de guardar toda la respuesta como archivo de audio.

Solicitud

curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-hd",
    "voice": "nova",
    "input": "Hello, welcome to TokenLab!"
  }' \
  --output speech.mp3

Muestras de voz

Las voces disponibles dependen del modelo. Los nombres siguientes son ejemplos, no una lista común para todos los modelos TTS.

VozDescripción
alloyNeutral, equilibrada
ashTranquila, medida
balladMelódica, expresiva
coralCálida, acogedora
echoCálida, conversacional
fableExpresiva, narrativa
novaAmigable, clara
onyxProfunda, autoritaria
sageSabia, reflexiva
shimmerSuave, delicada
verseDinámica, versátil

Ejemplo de respuesta

Respuesta

200 OK
<binary audio data>

Campos importantes

Content-Typestring

Tipo de medio de la respuesta HTTP: formato de audio o text/event-stream para SSE.

bodybinary | SSE

Bytes de audio con audio; flujo de eventos con sse. Elige el procesamiento según Content-Type y el modo solicitado.

MiniMax Speech 2.8 Turbo sintetiza un guion con una voz seleccionada mediante un flujo centrado en la velocidad. Es útil para interfaces de voz con respuesta rápida y narración.

{
  "model": "speech-2.8-turbo",
  "input": "Welcome to TokenLab.",
  "voice_id": "male-qn-qingse",
  "speed": 1,
  "response_format": "mp3",
  "stream_format": "audio"
}

Autorización

BearerAuth
AuthorizationBearer <token>

Autenticación con API Key. Cree o gestione API keys en Dashboard > API > API Keys.

Ubicación: header

Encabezados

X-TokenLab-Delivery-Policy?string

Política de entrega por solicitud. Sustituye los valores predeterminados de la API key y del Workspace. Auto intenta primero con TokenLab Verified y puede cambiar una vez a Official solo antes de la salida, la aceptación de la solicitud o la creación de recursos persistentes.

Valores permitidos

  • "auto"
  • "verified"
  • "official"

Cuerpo de la solicitud

application/json

Respuesta

application/json

application/json

application/json

application/json

application/json

application/json