Audio & Echtzeit

Sprache erstellen

Erzeugt Audio aus dem Eingabetext

POST
/v1/audio/speech

Anfragekörper

Der Antwortmodus hängt vom gewählten Modell und stream_format ab. Setzen Sie bei langen Eingaben das HTTP-Timeout auf mindestens 120s.

Optionale Felder, Stimmen, Ausgabeformate und SSE-Unterstützung hängen vom Modell ab. Prüfen Sie vor dem Senden GET /v1/models/{model}. Nicht unterstützte Parameter können 400 unsupported_parameter auslösen.

modelstringStandard: tts-1

TTS-Modell-ID. Aktuelle Modelle finden Sie mit GET /v1/models?recommended_for=tts.

inputstringerforderlich

Der Text, für den Audio erzeugt werden soll. Maximal 4096 Zeichen.

voicestring | object

Stimm-Auswahl. Übergeben Sie einen integrierten Namen wie nova, eine Gemini-Stimme wie Kore oder ein Objekt wie { "id": "voice-id" } für kompatible benutzerdefinierte Stimmen.

voice_idstring

Stimmen-ID für Modelle, die diesen Parameter unterstützen, etwa kompatible MiniMax-Sprachmodelle.

instructionsstring

Optionale Stil- oder Vortragsanweisungen für OpenAI-kompatible TTS-Modelle, die dieses Feld unterstützen.

promptstring

Optionaler Prompt für den Sprechstil bei Gemini TTS-Modellen.

language_codestring

Optionaler Sprachcode, zum Beispiel en-US, für Gemini-, xAI- und kompatible TTS-Routen.

response_formatstring

Audioformat. Häufige Werte sind mp3, opus, aac, flac, wav und pcm; unterstützte Werte variieren je nach Modellfamilie.

stream_formatstringStandard: audio

TokenLab-Auslieferungsformat: audio oder sse. stream_format=sse wird für tts-1 und tts-1-hd nicht unterstützt.

speednumber

Sprechgeschwindigkeit für Modellfamilien, die sie unterstützen (0.25 bis 4.0).

temperaturenumber

Sampling-Temperatur für Gemini-kompatible TTS-Routen (0 bis 2).

Antwort

stream_format=audio liefert Audiobytes. Modelle mit Unterstützung für stream_format=sse liefern text/event-stream; verarbeiten Sie dessen Ereignisse, statt die gesamte Antwort als Audiodatei zu speichern.

Anfrage

curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-hd",
    "voice": "nova",
    "input": "Hello, welcome to TokenLab!"
  }' \
  --output speech.mp3

Sprachbeispiele

Verfügbare Stimmen hängen vom Modell ab. Die folgenden Namen sind Beispiele und keine gemeinsame Stimmenliste aller TTS-Modelle.

StimmeBeschreibung
alloyNeutral, ausgewogen
ashRuhig, bedacht
balladMelodisch, ausdrucksstark
coralWarm, einladend
echoWarm, dialogorientiert
fableAusdrucksstark, erzählerisch
novaFreundlich, klar
onyxTief, autoritativ
sageWeise, nachdenklich
shimmerSanft, weich
verseDynamisch, vielseitig

Antwortbeispiel

Antwort

200 OK
<binary audio data>

Wichtige Felder

Content-Typestring

Medientyp der HTTP-Antwort: Audioformat oder text/event-stream bei SSE.

bodybinary | SSE

Audiobytes bei audio, Ereignisstream bei sse. Wählen Sie den Parser anhand von Content-Type und dem angeforderten Modus.

MiniMax Speech 2.8 Turbo vertont ein Skript mit einer ausgewählten Stimme und einem auf Geschwindigkeit ausgelegten Ablauf. Es eignet sich für reaktionsschnelle Sprachoberflächen und Sprechertexte.

{
  "model": "speech-2.8-turbo",
  "input": "Welcome to TokenLab.",
  "voice_id": "male-qn-qingse",
  "speed": 1,
  "response_format": "mp3",
  "stream_format": "audio"
}

Autorisierung

BearerAuth
AuthorizationBearer <token>

API-Key-Authentifizierung. Erstellen oder verwalten Sie API-Keys unter Dashboard > API > API Keys.

Ort: header

Header

X-TokenLab-Delivery-Policy?string

Zustellungsrichtlinie pro Anfrage. Überschreibt die API-Key- und Workspace-Standardeinstellungen. Versucht automatisch zuerst TokenLab Verified und kann vor der Ausgabe, der Annahme der Anfrage oder der Erstellung persistenter Ressourcen einmalig auf Official umstellen.

Zulässige Werte

  • "auto"
  • "verified"
  • "official"

Anfragekörper

application/json

Antwort

application/json

application/json

application/json

application/json

application/json

application/json