オーディオとリアルタイム

文字起こしを作成

音声を入力言語で文字起こしします

POST
/v1/audio/transcriptions

リクエストボディ

文字起こしは結果を直接返す場合と、HTTP 200、id、status で非同期タスクの受け付けを返す場合があります。非同期の場合は poll_url または /v1/tasks/{id} を確認してください。長い音声を同期処理する場合、タイムアウトは少なくとも 120s に設定してください。

filefile必須

文字起こしする音声ファイル。対応形式: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm。 最大ファイルサイズ: 25 MB。

modelstringデフォルト: whisper-1

文字起こしモデル ID。例: whisper-1、gpt-4o-transcribe。現在の候補は GET /v1/models?recommended_for=stt で確認してください。

languagestring

ISO-639-1 形式の音声言語(例: en, zh, ja)。

promptstring

モデルのスタイルを誘導したり、前のセグメントの続きを生成したりするための任意のテキスト。

response_formatstringデフォルト: json

出力形式。Whisper は json、text、srt、verbose_json、vtt に対応します。他のモデルの対応形式はモデル詳細で確認してください。

temperaturenumber

0~1 のサンプリング温度。このパラメーターに対応するモデルでのみ使用できます。

timestamp_granularitiesarray

対応モデルでは word と/または segment を指定できます。Whisper は response_format=verbose_json が必要です。multipart で複数値を渡す場合は timestamp_granularities[] を繰り返します。

レスポンス

以下のフィールドは JSON の文字起こし・翻訳応答を説明します。text、srt、vtt は JSON ではなくテキストや字幕を返します。追加フィールドはモデルと出力形式に依存します。

textstring

文字起こしされたテキスト。

verbose_json の場合:

taskstring

返される場合のタスク名。例: transcribe。

languagestring

検出された言語。

durationnumber

音声の長さ(秒)。

segmentsarray

タイムスタンプ付きの文字起こしセグメント。

wordsarray

単語レベルのタイムスタンプ(要求された場合)。

非同期の文字起こしタスクが受け付けられると、本文の代わりに次のフィールドを返します。

idstring

タスクID。

task_idstring

利用可能な場合の非同期タスク ID 別名です。

statusstring

タスクのステータス: pending、processing、completed、または failed。

poll_urlstring

作成レスポンスで提供された場合に優先して使うポーリング URL。

リクエスト

curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="en"

レスポンス

{
  "text": "Hello, this is a test of the transcription API."
}

翻訳

音声を英語に翻訳するには、translations endpoint を使用します:

with open("audio.mp3", "rb") as audio_file:
    response = client.audio.translations.create(
        model="whisper-1",
        file=audio_file
    )

print(response.text)

認証

BearerAuth
AuthorizationBearer <token>

APIキー認証。Dashboard > API > API KeysでAPIキーを作成または管理します。

場所: header

ヘッダー

X-TokenLab-Delivery-Policy?string

リクエストごとの配信ポリシー。APIキーおよびWorkspaceのデフォルト設定を上書きします。自動的にまず TokenLab Verified を試行し、出力、リクエストの受け入れ、または永続的なリソース作成の前に、一度だけ Official に切り替える場合があります。

指定できる値

  • "auto"
  • "verified"
  • "official"

リクエストボディ

multipart/form-data

レスポンス

application/json

application/json

application/json

application/json

application/json

application/json