Audio & Echtzeit
Sprache erstellen
Erzeugt Audio aus dem Eingabetext
Anfragekörper
Der Antwortmodus hängt vom gewählten Modell und stream_format ab. Setzen Sie bei langen Eingaben das HTTP-Timeout auf mindestens 120s.
Optionale Felder, Stimmen, Ausgabeformate und SSE-Unterstützung hängen vom Modell ab. Prüfen Sie vor dem Senden GET /v1/models/{model}. Nicht unterstützte Parameter können 400 unsupported_parameter auslösen.
tts-1TTS-Modell-ID. Aktuelle Modelle finden Sie mit GET /v1/models?recommended_for=tts.
Der Text, für den Audio erzeugt werden soll. Maximal 4096 Zeichen.
Stimm-Auswahl. Übergeben Sie einen integrierten Namen wie nova, eine Gemini-Stimme wie Kore oder ein Objekt wie { "id": "voice-id" } für kompatible benutzerdefinierte Stimmen.
Stimmen-ID für Modelle, die diesen Parameter unterstützen, etwa kompatible MiniMax-Sprachmodelle.
Optionale Stil- oder Vortragsanweisungen für OpenAI-kompatible TTS-Modelle, die dieses Feld unterstützen.
Optionaler Prompt für den Sprechstil bei Gemini TTS-Modellen.
Optionaler Sprachcode, zum Beispiel en-US, für Gemini-, xAI- und kompatible TTS-Routen.
Audioformat. Häufige Werte sind mp3, opus, aac, flac, wav und pcm; unterstützte Werte variieren je nach Modellfamilie.
audioTokenLab-Auslieferungsformat: audio oder sse. stream_format=sse wird für tts-1 und tts-1-hd nicht unterstützt.
Sprechgeschwindigkeit für Modellfamilien, die sie unterstützen (0.25 bis 4.0).
Sampling-Temperatur für Gemini-kompatible TTS-Routen (0 bis 2).
Antwort
stream_format=audio liefert Audiobytes. Modelle mit Unterstützung für stream_format=sse liefern text/event-stream; verarbeiten Sie dessen Ereignisse, statt die gesamte Antwort als Audiodatei zu speichern.
Anfrage
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3Sprachbeispiele
Verfügbare Stimmen hängen vom Modell ab. Die folgenden Namen sind Beispiele und keine gemeinsame Stimmenliste aller TTS-Modelle.
| Stimme | Beschreibung |
|---|---|
alloy | Neutral, ausgewogen |
ash | Ruhig, bedacht |
ballad | Melodisch, ausdrucksstark |
coral | Warm, einladend |
echo | Warm, dialogorientiert |
fable | Ausdrucksstark, erzählerisch |
nova | Freundlich, klar |
onyx | Tief, autoritativ |
sage | Weise, nachdenklich |
shimmer | Sanft, weich |
verse | Dynamisch, vielseitig |
Antwort
<binary audio data>Wichtige Felder
Medientyp der HTTP-Antwort: Audioformat oder text/event-stream bei SSE.
Audiobytes bei audio, Ereignisstream bei sse. Wählen Sie den Parser anhand von Content-Type und dem angeforderten Modus.
MiniMax Speech 2.8 Turbo vertont ein Skript mit einer ausgewählten Stimme und einem auf Geschwindigkeit ausgelegten Ablauf. Es eignet sich für reaktionsschnelle Sprachoberflächen und Sprechertexte.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}Autorisierung
BearerAuth API-Key-Authentifizierung. Erstellen oder verwalten Sie API-Keys unter Dashboard > API > API Keys.
Ort: header
Header
Zustellungsrichtlinie pro Anfrage. Überschreibt die API-Key- und Workspace-Standardeinstellungen. Versucht automatisch zuerst TokenLab Verified und kann vor der Ausgabe, der Annahme der Anfrage oder der Erstellung persistenter Ressourcen einmalig auf Official umstellen.
Zulässige Werte
- "auto"
- "verified"
- "official"
Anfragekörper
application/json
Antwort
application/json
application/json
application/json
application/json
application/json
application/json