Audio & Echtzeit

Transkription erstellen

Transkribiert Audio in die Eingabesprache

POST
/v1/audio/transcriptions

Anfragekörper

Eine Transkription liefert entweder direkt den Text oder bestätigt einen asynchronen Auftrag mit HTTP 200, id und status. Folgen Sie bei einem Auftrag poll_url oder fragen Sie /v1/tasks/{id} ab. Für längere synchrone Audiodateien sollte das Timeout mindestens 120s betragen.

filefileerforderlich

Audiodatei zur Transkription. Unterstützte Formate: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Maximale Dateigröße: 25 MB.

modelstringStandard: whisper-1

Transkriptionsmodell-ID, etwa whisper-1 oder gpt-4o-transcribe. Aktuelle Modelle finden Sie mit GET /v1/models?recommended_for=stt.

languagestring

Sprache des Audios im ISO-639-1-Format (z. B. en, zh, ja).

promptstring

Optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen.

response_formatstringStandard: json

Ausgabeformat. Whisper unterstützt json, text, srt, verbose_json und vtt; andere Modelle können eine andere Auswahl unterstützen. Prüfen Sie die Modelldetails.

temperaturenumber

Sampling-Temperatur von 0 bis 1, nur für Modelle, die diesen Parameter unterstützen.

timestamp_granularitiesarray

word und/oder segment, sofern vom Modell unterstützt. Whisper erfordert response_format=verbose_json. Wiederholen Sie in Multipart-Anfragen timestamp_granularities[] für mehrere Werte.

Antwort

Die folgenden Felder beschreiben JSON-Antworten für Transkription oder Übersetzung. text, srt und vtt liefern Text bzw. Untertitel statt eines JSON-Objekts. Zusätzliche Felder hängen vom Modell und Ausgabeformat ab.

textstring

Der transkribierte Text.

Für verbose_json:

taskstring

Aufgabenname, falls zurückgegeben, etwa transcribe.

languagestring

Erkannte Sprache.

durationnumber

Audiodauer in Sekunden.

segmentsarray

Transkriptionssegmente mit Zeitstempeln.

wordsarray

Zeitstempel auf Wortebene (falls angefordert).

Ein angenommener asynchroner Transkriptionsauftrag liefert statt des Transkripts folgende Felder:

idstring

Aufgaben-ID.

task_idstring

Alias der asynchronen Task-ID, wenn verfügbar.

statusstring

Aufgabenstatus: pending, processing, completed oder failed.

poll_urlstring

Bevorzugte Polling-URL, wenn die Erstellungsantwort sie bereitstellt.

Anfrage

curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="en"

Antwort

{
  "text": "Hello, this is a test of the transcription API."
}

Übersetzung

Um Audio ins Englische zu übersetzen, verwenden Sie den translations-Endpunkt:

with open("audio.mp3", "rb") as audio_file:
    response = client.audio.translations.create(
        model="whisper-1",
        file=audio_file
    )

print(response.text)

Autorisierung

BearerAuth
AuthorizationBearer <token>

API-Key-Authentifizierung. Erstellen oder verwalten Sie API-Keys unter Dashboard > API > API Keys.

Ort: header

Header

X-TokenLab-Delivery-Policy?string

Zustellungsrichtlinie pro Anfrage. Überschreibt die API-Key- und Workspace-Standardeinstellungen. Versucht automatisch zuerst TokenLab Verified und kann vor der Ausgabe, der Annahme der Anfrage oder der Erstellung persistenter Ressourcen einmalig auf Official umstellen.

Zulässige Werte

  • "auto"
  • "verified"
  • "official"

Anfragekörper

multipart/form-data

Antwort

application/json

application/json

application/json

application/json

application/json

application/json