Âm thanh & thời gian thực
Tạo bản chép lời
Chép lời audio sang ngôn ngữ đầu vào
Nội dung Request
Chép lời có thể trả ngay văn bản hoặc chấp nhận tác vụ bất đồng bộ với HTTP 200, id và status. Với tác vụ được chấp nhận, theo poll_url hoặc truy vấn /v1/tasks/{id}. Với âm thanh dài được xử lý đồng bộ, đặt thời gian chờ ít nhất 120s.
Tệp audio cần chép lời. Các định dạng được hỗ trợ: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Kích thước tệp tối đa: 25 MB.
whisper-1ID mô hình chép lời, chẳng hạn whisper-1 hoặc gpt-4o-transcribe. Xem các lựa chọn hiện tại bằng GET /v1/models?recommended_for=stt.
Ngôn ngữ của audio theo định dạng ISO-639-1 (ví dụ: en, zh, ja).
Văn bản tùy chọn để định hướng phong cách của model hoặc tiếp tục một đoạn trước đó.
jsonĐịnh dạng đầu ra. Whisper hỗ trợ json, text, srt, verbose_json và vtt; mô hình khác có thể hỗ trợ tập định dạng khác. Kiểm tra chi tiết mô hình.
Nhiệt độ lấy mẫu từ 0 đến 1, chỉ dành cho mô hình hỗ trợ tham số này.
word và/hoặc segment, nếu mô hình hỗ trợ. Whisper yêu cầu response_format=verbose_json. Trong multipart, lặp lại timestamp_granularities[] để gửi nhiều giá trị.
Phản hồi
Các trường dưới đây mô tả phản hồi JSON cho chép lời hoặc dịch. text, srt và vtt trả về văn bản hoặc phụ đề thô thay vì đối tượng JSON. Trường bổ sung phụ thuộc vào mô hình và định dạng đầu ra.
Văn bản đã được chép lời.
Đối với verbose_json:
Tên tác vụ khi được trả về, chẳng hạn transcribe.
Ngôn ngữ được phát hiện.
Thời lượng audio tính bằng giây.
Các đoạn chép lời kèm dấu thời gian.
Dấu thời gian ở cấp độ từ (nếu được yêu cầu).
Tác vụ chép lời bất đồng bộ được chấp nhận trả về các trường sau thay vì văn bản:
ID của tác vụ.
Bí danh của mã tác vụ bất đồng bộ khi có sẵn.
Trạng thái tác vụ: pending, processing, completed, hoặc failed.
URL polling ưu tiên khi phản hồi tạo tác vụ cung cấp.
Yêu cầu
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"Phản hồi
{
"text": "Hello, this is a test of the transcription API."
}Dịch
Để dịch audio sang tiếng Anh, hãy sử dụng endpoint translations:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)Xác thực
BearerAuth Xác thực bằng Khóa API. Tạo hoặc quản lý khóa API trong Dashboard > API > API Keys.
Vị trí: header
Header
Chính sách phân phối theo yêu cầu. Ghi đè các mặc định của API key và Workspace. Tự động thử TokenLab Verified trước và có thể chuyển đổi một lần sang Official chỉ trước khi xuất, chấp nhận yêu cầu hoặc tạo tài nguyên cố định.
Giá trị hợp lệ
- "auto"
- "verified"
- "official"
Nội dung yêu cầu
multipart/form-data
Phản hồi
application/json
application/json
application/json
application/json
application/json
application/json