Áudio e tempo real

Criar Fala

Gera áudio a partir do texto de entrada

POST
/v1/audio/speech

Corpo da Requisição

O modo da resposta depende do modelo escolhido e de stream_format. Para entradas longas, configure um tempo limite HTTP de pelo menos 120s.

Campos opcionais, vozes, formatos e suporte a SSE dependem do modelo. Consulte GET /v1/models/{model} antes de enviá-los. Parâmetros não aceitos podem retornar 400 unsupported_parameter.

modelstringpadrão: tts-1

ID do modelo TTS. Consulte as opções atuais com GET /v1/models?recommended_for=tts.

inputstringobrigatório

O texto para o qual o áudio será gerado. Máximo de 4096 caracteres.

voicestring | object

Seletor de voz. Envie um nome integrado como nova, uma voz Gemini como Kore ou um objeto como { "id": "voice-id" } para vozes personalizadas compatíveis.

voice_idstring

ID de voz para modelos que aceitam esse parâmetro, como modelos de fala MiniMax compatíveis.

instructionsstring

Instruções opcionais de estilo ou entrega para modelos TTS compatíveis com OpenAI que oferecem suporte.

promptstring

Prompt opcional de estilo de fala para modelos Gemini TTS.

language_codestring

Código de idioma opcional, por exemplo en-US, para rotas Gemini, xAI e TTS compatíveis.

response_formatstring

Formato de áudio. Valores comuns incluem mp3, opus, aac, flac, wav e pcm; os valores compatíveis variam por família de modelo.

stream_formatstringpadrão: audio

Formato de entrega do TokenLab: audio ou sse. stream_format=sse não é compatível com tts-1 nem tts-1-hd.

speednumber

Velocidade de fala para famílias de modelos que oferecem suporte (0.25 a 4.0).

temperaturenumber

Temperatura de amostragem para rotas TTS compatíveis com Gemini (0 a 2).

Resposta

stream_format=audio retorna bytes de áudio. Modelos compatíveis com stream_format=sse retornam text/event-stream; processe os eventos em vez de salvar toda a resposta como arquivo de áudio.

Requisição

curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-hd",
    "voice": "nova",
    "input": "Hello, welcome to TokenLab!"
  }' \
  --output speech.mp3

Amostras de Voz

As vozes disponíveis dependem do modelo. Os nomes abaixo são exemplos, não uma lista comum a todos os modelos TTS.

VozDescrição
alloyNeutra, equilibrada
ashCalma, medida
balladMelódica, expressiva
coralAcolhedora, convidativa
echoAcolhedora, conversacional
fableExpressiva, narrativa
novaAmigável, clara
onyxProfunda, autoritativa
sageSábia, reflexiva
shimmerSuave, delicada
verseDinâmica, versátil

Exemplo de resposta

Resposta

200 OK
<binary audio data>

Campos importantes

Content-Typestring

Tipo de mídia da resposta HTTP: formato de áudio ou text/event-stream para SSE.

bodybinary | SSE

Bytes de áudio em audio; fluxo de eventos em sse. Escolha o processamento conforme Content-Type e o modo solicitado.

MiniMax Speech 2.8 Turbo sintetiza um roteiro com uma voz selecionada em um fluxo voltado à velocidade. É útil para interfaces de voz com resposta rápida e narração.

{
  "model": "speech-2.8-turbo",
  "input": "Welcome to TokenLab.",
  "voice_id": "male-qn-qingse",
  "speed": 1,
  "response_format": "mp3",
  "stream_format": "audio"
}

Autorização

BearerAuth
AuthorizationBearer <token>

Autenticação por Chave de API. Crie ou gerencie chaves de API em Dashboard > API > API Keys.

Local: header

Cabeçalhos

X-TokenLab-Delivery-Policy?string

Política de entrega por solicitação. Substitui os padrões da API key e do Workspace. Tenta automaticamente o TokenLab Verified primeiro e pode alternar uma vez para Official apenas antes da saída, aceitação da solicitação ou criação de recurso persistente.

Valores permitidos

  • "auto"
  • "verified"
  • "official"

Corpo da requisição

application/json

Resposta

application/json

application/json

application/json

application/json

application/json

application/json