Audio & temps réel
Créer de la parole
Génère de l'audio à partir du texte d'entrée
Corps de la requête
Le mode de réponse dépend du modèle choisi et de stream_format. Pour une entrée longue, prévoyez un délai HTTP d’au moins 120s.
Les champs facultatifs, voix, formats et la prise en charge de SSE dépendent du modèle. Vérifiez GET /v1/models/{model} avant de les envoyer. Les paramètres non pris en charge peuvent renvoyer 400 unsupported_parameter.
tts-1Identifiant du modèle TTS. Consultez GET /v1/models?recommended_for=tts pour les choix actuels.
Le texte pour lequel générer l'audio. Maximum 4096 caractères.
Sélecteur de voix. Passez un nom intégré comme nova, une voix Gemini comme Kore, ou un objet comme { "id": "voice-id" } pour les voix personnalisées compatibles.
Identifiant vocal pour les modèles qui acceptent ce paramètre, notamment les modèles vocaux MiniMax compatibles.
Instructions optionnelles de style ou de rendu pour les modèles TTS compatibles OpenAI qui les prennent en charge.
Prompt optionnel de style de parole pour les modèles Gemini TTS.
Code de langue optionnel, par exemple en-US, pour les routes Gemini, xAI et TTS compatibles.
Format audio. Les valeurs courantes incluent mp3, opus, aac, flac, wav et pcm ; les valeurs prises en charge varient selon la famille de modèles.
audioFormat de livraison TokenLab : audio ou sse. stream_format=sse n'est pas pris en charge pour tts-1 ni tts-1-hd.
Vitesse de parole pour les familles de modèles qui la prennent en charge (0.25 à 4.0).
Température d'échantillonnage pour les routes TTS compatibles Gemini (0 à 2).
Réponse
stream_format=audio renvoie des octets audio. Les modèles compatibles avec stream_format=sse renvoient text/event-stream : analysez les événements au lieu d’enregistrer toute la réponse comme fichier audio.
Requête
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3Exemples de voix
Les voix disponibles dépendent du modèle. Les noms ci-dessous sont des exemples, pas une liste commune à tous les modèles TTS.
| Voix | Description |
|---|---|
alloy | Neutre, équilibrée |
ash | Calme, mesurée |
ballad | Mélodique, expressive |
coral | Chaleureuse, accueillante |
echo | Chaleureuse, conversationnelle |
fable | Expressif, narratif |
nova | Amicale, claire |
onyx | Grave, autoritaire |
sage | Sage, réfléchie |
shimmer | Douce, délicate |
verse | Dynamique, polyvalente |
Réponse
<binary audio data>Champs importants
Type de média HTTP : format audio ou text/event-stream pour SSE.
Octets audio pour audio, flux d’événements pour sse. Choisissez l’analyseur selon Content-Type et le mode demandé.
MiniMax Speech 2.8 Turbo synthétise un script avec une voix choisie selon un processus axé sur la rapidité. Il convient aux interfaces vocales réactives et à la narration.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}Autorisation
BearerAuth Authentification par clé API. Créez ou gérez vos clés API dans Dashboard > API > API Keys.
Emplacement: header
En-têtes
Politique de livraison par requête. Remplace les valeurs par défaut de la clé API et de l'espace de travail. Tente automatiquement TokenLab Verified en premier et peut basculer une fois vers Official uniquement avant la sortie, l'acceptation de la requête ou la création de ressource persistante.
Valeurs possibles
- "auto"
- "verified"
- "official"
Corps de la requête
application/json
Réponse
application/json
application/json
application/json
application/json
application/json
application/json