오디오 및 실시간
전사 생성
오디오를 입력 언어로 전사합니다
요청 본문
전사는 텍스트를 즉시 반환하거나 HTTP 200, id, status로 비동기 작업 수락을 반환할 수 있습니다. 비동기 작업은 poll_url 또는 /v1/tasks/{id}로 조회하세요. 긴 오디오를 동기 처리할 때는 클라이언트 제한 시간을 최소 120s로 설정하세요.
전사할 오디오 파일입니다. 지원 형식: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. 최대 파일 크기: 25 MB.
whisper-1전사 모델 ID입니다. 예: whisper-1, gpt-4o-transcribe. GET /v1/models?recommended_for=stt에서 현재 모델을 확인하세요.
ISO-639-1 형식의 오디오 언어입니다(예: en, zh, ja).
모델의 스타일을 유도하거나 이전 세그먼트를 이어가기 위한 선택적 텍스트입니다.
json출력 형식입니다. Whisper는 json, text, srt, verbose_json, vtt를 지원합니다. 다른 모델의 지원 범위는 모델 세부정보에서 확인하세요.
0~1 범위의 샘플링 온도입니다. 이 매개변수를 지원하는 모델에서만 사용하세요.
지원 모델에서 word 및/또는 segment를 지정합니다. Whisper는 response_format=verbose_json이 필요합니다. multipart에서 여러 값을 보내려면 timestamp_granularities[]를 반복하세요.
응답
다음 필드는 JSON 전사 또는 번역 응답에 해당합니다. text, srt, vtt는 JSON 객체 대신 원시 텍스트나 자막을 반환합니다. 추가 필드는 모델과 출력 형식에 따라 다릅니다.
전사된 텍스트입니다.
verbose_json의 경우:
반환되는 경우의 작업 이름입니다. 예: transcribe.
감지된 언어입니다.
초 단위 오디오 길이입니다.
타임스탬프가 포함된 전사 세그먼트입니다.
단어 수준 타임스탬프입니다(요청한 경우).
수락된 비동기 전사 작업은 전사 텍스트 대신 다음 필드를 반환합니다.
작업 ID.
사용 가능할 때의 비동기 작업 ID 별칭입니다.
작업 상태: pending, processing, completed 또는 failed.
생성 응답에서 제공될 때 우선 사용할 폴링 URL입니다.
요청
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"응답
{
"text": "Hello, this is a test of the transcription API."
}번역
오디오를 영어로 번역하려면 translations 엔드포인트를 사용하세요:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)인증
BearerAuth API 키 인증입니다. Dashboard > API > API Keys에서 API 키를 생성하거나 관리하십시오.
위치: header
헤더
요청별 전송 정책입니다. API 키 및 Workspace 기본값을 재정의합니다. 자동으로 TokenLab Verified를 먼저 시도하며, 출력, 요청 수락 또는 영구 리소스 생성 전에 Official 전용으로 한 번 전환될 수 있습니다.
허용 값
- "auto"
- "verified"
- "official"
요청 본문
multipart/form-data
응답
application/json
application/json
application/json
application/json
application/json
application/json