オーディオとリアルタイム
文字起こしを作成
音声を入力言語で文字起こしします
リクエストボディ
文字起こしは結果を直接返す場合と、HTTP 200、id、status で非同期タスクの受け付けを返す場合があります。非同期の場合は poll_url または /v1/tasks/{id} を確認してください。長い音声を同期処理する場合、タイムアウトは少なくとも 120s に設定してください。
文字起こしする音声ファイル。対応形式: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm。 最大ファイルサイズ: 25 MB。
whisper-1文字起こしモデル ID。例: whisper-1、gpt-4o-transcribe。現在の候補は GET /v1/models?recommended_for=stt で確認してください。
ISO-639-1 形式の音声言語(例: en, zh, ja)。
モデルのスタイルを誘導したり、前のセグメントの続きを生成したりするための任意のテキスト。
json出力形式。Whisper は json、text、srt、verbose_json、vtt に対応します。他のモデルの対応形式はモデル詳細で確認してください。
0~1 のサンプリング温度。このパラメーターに対応するモデルでのみ使用できます。
対応モデルでは word と/または segment を指定できます。Whisper は response_format=verbose_json が必要です。multipart で複数値を渡す場合は timestamp_granularities[] を繰り返します。
レスポンス
以下のフィールドは JSON の文字起こし・翻訳応答を説明します。text、srt、vtt は JSON ではなくテキストや字幕を返します。追加フィールドはモデルと出力形式に依存します。
文字起こしされたテキスト。
verbose_json の場合:
返される場合のタスク名。例: transcribe。
検出された言語。
音声の長さ(秒)。
タイムスタンプ付きの文字起こしセグメント。
単語レベルのタイムスタンプ(要求された場合)。
非同期の文字起こしタスクが受け付けられると、本文の代わりに次のフィールドを返します。
タスクID。
利用可能な場合の非同期タスク ID 別名です。
タスクのステータス: pending、processing、completed、または failed。
作成レスポンスで提供された場合に優先して使うポーリング URL。
リクエスト
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"レスポンス
{
"text": "Hello, this is a test of the transcription API."
}翻訳
音声を英語に翻訳するには、translations endpoint を使用します:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)認証
BearerAuth APIキー認証。Dashboard > API > API KeysでAPIキーを作成または管理します。
場所: header
ヘッダー
リクエストごとの配信ポリシー。APIキーおよびWorkspaceのデフォルト設定を上書きします。自動的にまず TokenLab Verified を試行し、出力、リクエストの受け入れ、または永続的なリソース作成の前に、一度だけ Official に切り替える場合があります。
指定できる値
- "auto"
- "verified"
- "official"
リクエストボディ
multipart/form-data
レスポンス
application/json
application/json
application/json
application/json
application/json
application/json