Audio & Echtzeit
Transkription erstellen
Transkribiert Audio in die Eingabesprache
Anfragekörper
Eine Transkription liefert entweder direkt den Text oder bestätigt einen asynchronen Auftrag mit HTTP 200, id und status. Folgen Sie bei einem Auftrag poll_url oder fragen Sie /v1/tasks/{id} ab. Für längere synchrone Audiodateien sollte das Timeout mindestens 120s betragen.
Audiodatei zur Transkription. Unterstützte Formate: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Maximale Dateigröße: 25 MB.
whisper-1Transkriptionsmodell-ID, etwa whisper-1 oder gpt-4o-transcribe. Aktuelle Modelle finden Sie mit GET /v1/models?recommended_for=stt.
Sprache des Audios im ISO-639-1-Format (z. B. en, zh, ja).
Optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen.
jsonAusgabeformat. Whisper unterstützt json, text, srt, verbose_json und vtt; andere Modelle können eine andere Auswahl unterstützen. Prüfen Sie die Modelldetails.
Sampling-Temperatur von 0 bis 1, nur für Modelle, die diesen Parameter unterstützen.
word und/oder segment, sofern vom Modell unterstützt. Whisper erfordert response_format=verbose_json. Wiederholen Sie in Multipart-Anfragen timestamp_granularities[] für mehrere Werte.
Antwort
Die folgenden Felder beschreiben JSON-Antworten für Transkription oder Übersetzung. text, srt und vtt liefern Text bzw. Untertitel statt eines JSON-Objekts. Zusätzliche Felder hängen vom Modell und Ausgabeformat ab.
Der transkribierte Text.
Für verbose_json:
Aufgabenname, falls zurückgegeben, etwa transcribe.
Erkannte Sprache.
Audiodauer in Sekunden.
Transkriptionssegmente mit Zeitstempeln.
Zeitstempel auf Wortebene (falls angefordert).
Ein angenommener asynchroner Transkriptionsauftrag liefert statt des Transkripts folgende Felder:
Aufgaben-ID.
Alias der asynchronen Task-ID, wenn verfügbar.
Aufgabenstatus: pending, processing, completed oder failed.
Bevorzugte Polling-URL, wenn die Erstellungsantwort sie bereitstellt.
Anfrage
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"Antwort
{
"text": "Hello, this is a test of the transcription API."
}Übersetzung
Um Audio ins Englische zu übersetzen, verwenden Sie den translations-Endpunkt:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)Autorisierung
BearerAuth API-Key-Authentifizierung. Erstellen oder verwalten Sie API-Keys unter Dashboard > API > API Keys.
Ort: header
Header
Zustellungsrichtlinie pro Anfrage. Überschreibt die API-Key- und Workspace-Standardeinstellungen. Versucht automatisch zuerst TokenLab Verified und kann vor der Ausgabe, der Annahme der Anfrage oder der Erstellung persistenter Ressourcen einmalig auf Official umstellen.
Zulässige Werte
- "auto"
- "verified"
- "official"
Anfragekörper
multipart/form-data
Antwort
application/json
application/json
application/json
application/json
application/json
application/json