TokenLab

Âm thanh & thời gian thực

Tạo bản chép lời

Chép lời audio sang ngôn ngữ đầu vào

POST
/v1/audio/transcriptions

Nội dung Request

Chép lời có thể trả ngay văn bản hoặc chấp nhận tác vụ bất đồng bộ với HTTP 200, id và status. Với tác vụ được chấp nhận, theo poll_url hoặc truy vấn /v1/tasks/{id}. Với âm thanh dài được xử lý đồng bộ, đặt thời gian chờ ít nhất 120s.

filefilebắt buộc

Tệp audio cần chép lời. Các định dạng được hỗ trợ: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Kích thước tệp tối đa: 25 MB.

modelstringmặc định: whisper-1

ID mô hình chép lời, chẳng hạn whisper-1 hoặc gpt-4o-transcribe. Xem các lựa chọn hiện tại bằng GET /v1/models?recommended_for=stt.

languagestring

Ngôn ngữ của audio theo định dạng ISO-639-1 (ví dụ: en, zh, ja).

promptstring

Văn bản tùy chọn để định hướng phong cách của model hoặc tiếp tục một đoạn trước đó.

response_formatstringmặc định: json

Định dạng đầu ra. Whisper hỗ trợ json, text, srt, verbose_json và vtt; mô hình khác có thể hỗ trợ tập định dạng khác. Kiểm tra chi tiết mô hình.

temperaturenumber

Nhiệt độ lấy mẫu từ 0 đến 1, chỉ dành cho mô hình hỗ trợ tham số này.

timestamp_granularitiesarray

word và/hoặc segment, nếu mô hình hỗ trợ. Whisper yêu cầu response_format=verbose_json. Trong multipart, lặp lại timestamp_granularities[] để gửi nhiều giá trị.

Phản hồi

Các trường dưới đây mô tả phản hồi JSON cho chép lời hoặc dịch. text, srt và vtt trả về văn bản hoặc phụ đề thô thay vì đối tượng JSON. Trường bổ sung phụ thuộc vào mô hình và định dạng đầu ra.

textstring

Văn bản đã được chép lời.

Đối với verbose_json:

taskstring

Tên tác vụ khi được trả về, chẳng hạn transcribe.

languagestring

Ngôn ngữ được phát hiện.

durationnumber

Thời lượng audio tính bằng giây.

segmentsarray

Các đoạn chép lời kèm dấu thời gian.

wordsarray

Dấu thời gian ở cấp độ từ (nếu được yêu cầu).

Tác vụ chép lời bất đồng bộ được chấp nhận trả về các trường sau thay vì văn bản:

idstring

ID của tác vụ.

task_idstring

Bí danh của mã tác vụ bất đồng bộ khi có sẵn.

statusstring

Trạng thái tác vụ: pending, processing, completed, hoặc failed.

poll_urlstring

URL polling ưu tiên khi phản hồi tạo tác vụ cung cấp.

Yêu cầu

curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="en"

Phản hồi

{
  "text": "Hello, this is a test of the transcription API."
}

Dịch

Để dịch audio sang tiếng Anh, hãy sử dụng endpoint translations:

with open("audio.mp3", "rb") as audio_file:
    response = client.audio.translations.create(
        model="whisper-1",
        file=audio_file
    )

print(response.text)

Xác thực

BearerAuth
AuthorizationBearer <token>

Xác thực bằng Khóa API. Tạo hoặc quản lý khóa API trong Dashboard > API > API Keys.

Vị trí: header

Header

X-TokenLab-Delivery-Policy?string

Chính sách phân phối theo yêu cầu. Ghi đè các mặc định của API key và Workspace. Tự động thử TokenLab Verified trước và có thể chuyển đổi một lần sang Official chỉ trước khi xuất, chấp nhận yêu cầu hoặc tạo tài nguyên cố định.

Giá trị hợp lệ

  • "auto"
  • "verified"
  • "official"

Nội dung yêu cầu

multipart/form-data

Phản hồi

application/json

application/json

application/json

application/json

application/json

application/json