オーディオとリアルタイム

翻訳を作成

音声を英語テキストに翻訳します

POST
/v1/audio/translations

概要

サポートされている任意の言語の音声を英語テキストに翻訳します。文字起こしとは異なり、この endpoint は入力言語に関係なく常に英語テキストを出力します。

このエンドポイントは音声を英語に翻訳します。音声翻訳では language は未対応のため、送信すると unsupported_parameter を返す場合があります。テキスト翻訳には POST /v1/translations を使用してください。recommended_for=translation はそのテキスト API 用です。

リクエストボディ

翻訳の処理完了後に応答します。音声が長い場合、HTTP クライアントのタイムアウトを少なくとも 120s に設定してください。

filefile必須

翻訳する音声ファイル。サポートされている形式: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm。最大ファイルサイズは 25 MB です。

modelstringデフォルト: whisper-1

音声翻訳モデル ID。例: whisper-1。現在のモデル詳細で POST /v1/audio/translations への対応を確認してください。

promptstring

model のスタイルを誘導したり、前のセグメントの続きを生成したりするための任意のテキストです。英語である必要があります。

response_formatstringデフォルト: json

出力形式。Whisper は json、text、srt、verbose_json、vtt に対応します。他のモデルの対応形式はモデル詳細で確認してください。

temperaturenumber

0~1 のサンプリング温度。このパラメーターに対応するモデルでのみ使用できます。

レスポンス

以下のフィールドは JSON の文字起こし・翻訳応答を説明します。text、srt、vtt は JSON ではなくテキストや字幕を返します。追加フィールドはモデルと出力形式に依存します。

textstring

英語に翻訳されたテキスト。

verbose_json 形式では、レスポンスには以下も含まれます:

languagestring

応答に含まれる場合の言語ラベル。

durationnumber

入力音声の長さ(秒)。

segmentsarray

タイムスタンプ付きの翻訳済みテキストのセグメント。

リクエスト

curl -X POST "https://api.tokenlab.sh/v1/audio/translations" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F "file=@german_audio.mp3" \
  -F "model=whisper-1"

レスポンス

{
  "text": "Hello, my name is Wolfgang and I come from Germany. Where are you from?"
}

翻訳と文字起こしの違い

機能翻訳文字起こし
出力言語常に英語入力と同じ
ユースケース外国語の音声を英語に変換元の言語を保持
language parameter該当なし任意のヒント

認証

BearerAuth
AuthorizationBearer <token>

APIキー認証。Dashboard > API > API KeysでAPIキーを作成または管理します。

場所: header

ヘッダー

X-TokenLab-Delivery-Policy?string

リクエストごとの配信ポリシー。APIキーおよびWorkspaceのデフォルト設定を上書きします。自動的にまず TokenLab Verified を試行し、出力、リクエストの受け入れ、または永続的なリソース作成の前に、一度だけ Official に切り替える場合があります。

指定できる値

  • "auto"
  • "verified"
  • "official"

リクエストボディ

multipart/form-data

レスポンス

application/json

application/json

application/json

application/json

application/json

application/json