Áudio e tempo real
Criar Fala
Gera áudio a partir do texto de entrada
Corpo da Requisição
O modo da resposta depende do modelo escolhido e de stream_format. Para entradas longas, configure um tempo limite HTTP de pelo menos 120s.
Campos opcionais, vozes, formatos e suporte a SSE dependem do modelo. Consulte GET /v1/models/{model} antes de enviá-los. Parâmetros não aceitos podem retornar 400 unsupported_parameter.
tts-1ID do modelo TTS. Consulte as opções atuais com GET /v1/models?recommended_for=tts.
O texto para o qual o áudio será gerado. Máximo de 4096 caracteres.
Seletor de voz. Envie um nome integrado como nova, uma voz Gemini como Kore ou um objeto como { "id": "voice-id" } para vozes personalizadas compatíveis.
ID de voz para modelos que aceitam esse parâmetro, como modelos de fala MiniMax compatíveis.
Instruções opcionais de estilo ou entrega para modelos TTS compatíveis com OpenAI que oferecem suporte.
Prompt opcional de estilo de fala para modelos Gemini TTS.
Código de idioma opcional, por exemplo en-US, para rotas Gemini, xAI e TTS compatíveis.
Formato de áudio. Valores comuns incluem mp3, opus, aac, flac, wav e pcm; os valores compatíveis variam por família de modelo.
audioFormato de entrega do TokenLab: audio ou sse. stream_format=sse não é compatível com tts-1 nem tts-1-hd.
Velocidade de fala para famílias de modelos que oferecem suporte (0.25 a 4.0).
Temperatura de amostragem para rotas TTS compatíveis com Gemini (0 a 2).
Resposta
stream_format=audio retorna bytes de áudio. Modelos compatíveis com stream_format=sse retornam text/event-stream; processe os eventos em vez de salvar toda a resposta como arquivo de áudio.
Requisição
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3Amostras de Voz
As vozes disponíveis dependem do modelo. Os nomes abaixo são exemplos, não uma lista comum a todos os modelos TTS.
| Voz | Descrição |
|---|---|
alloy | Neutra, equilibrada |
ash | Calma, medida |
ballad | Melódica, expressiva |
coral | Acolhedora, convidativa |
echo | Acolhedora, conversacional |
fable | Expressiva, narrativa |
nova | Amigável, clara |
onyx | Profunda, autoritativa |
sage | Sábia, reflexiva |
shimmer | Suave, delicada |
verse | Dinâmica, versátil |
Resposta
<binary audio data>Campos importantes
Tipo de mídia da resposta HTTP: formato de áudio ou text/event-stream para SSE.
Bytes de áudio em audio; fluxo de eventos em sse. Escolha o processamento conforme Content-Type e o modo solicitado.
MiniMax Speech 2.8 Turbo sintetiza um roteiro com uma voz selecionada em um fluxo voltado à velocidade. É útil para interfaces de voz com resposta rápida e narração.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}Autorização
BearerAuth Autenticação por Chave de API. Crie ou gerencie chaves de API em Dashboard > API > API Keys.
Local: header
Cabeçalhos
Política de entrega por solicitação. Substitui os padrões da API key e do Workspace. Tenta automaticamente o TokenLab Verified primeiro e pode alternar uma vez para Official apenas antes da saída, aceitação da solicitação ou criação de recurso persistente.
Valores permitidos
- "auto"
- "verified"
- "official"
Corpo da requisição
application/json
Resposta
application/json
application/json
application/json
application/json
application/json
application/json