Alibaba: Paraformer v2
paraformer-v2- 가격
- 부터 $0.000012
- 모달리티
- 오디오
Paraformer v2 소개
Paraformer v2는 회의 및 긴 대화의 오프라인 녹취록을 위한 Alibaba의 파일 기반 음성 인식 모델입니다. 최대 2GB 및 12시간 분량의 녹음 파일에 대해 비동기식으로 호출됩니다. Paraformer 8K v2와 비교하면 일반적인 광대역 오디오용으로 설계되었으며, 실시간 모델과 비교하면 즉시성 대신 화자 분리(diarization) 및 핫워드(hotwords)가 포함된 완전한 녹취록을 제공합니다.
강점
- Alibaba 문서에 따라 파일당 최대 12시간 또는 2GB의 매우 긴 녹음 파일을 처리합니다.
- 타임스탬프가 항상 포함되므로 이를 얻기 위한 별도의 옵션은 필요하지 않습니다.
- 화자 분리 기능은 회의 및 그룹 토론에서 참가자를 구분합니다.
- 민감 단어 필터링은 녹취록 텍스트에서 지정된 용어를 마스킹할 수 있습니다.
다른 모델이 필요한 경우
- 결과는 작업이 완료된 후 도착합니다. 실시간 자막이 필요한 경우 Paraformer Realtime v2가 필요합니다.
- 8kHz 전화 녹음의 경우 8K 변형 모델이 오디오에 더 적합합니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
음성-텍스트 변환TokenLab 엔드포인트POST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
음성-텍스트 변환
초당- Official 가격
- $0.00001176
- Official
- $0.00001176
- 할인
- —
| Official 가격초당 | Official초당 | 할인 | |
|---|---|---|---|
| 음성-텍스트 변환 | $0.00001176 | $0.00001176 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Paraformer v2을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/transcriptions에서 paraformer-v2로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
회의 아카이브
저장된 회의 녹음 파일을 화자 라벨과 타임스탬프가 포함된 검색 가능한 텍스트로 변환합니다.
강의 녹취록
수 시간 분량의 강의를 한 번에 녹취한 후, 학생들을 위해 텍스트를 색인화하거나 요약합니다.
콘텐츠 조정 준비
녹취록을 더 넓은 팀과 공유하기 전에 설정된 민감 단어를 마스킹합니다.
프롬프트 예제
이 3시간짜리 전체 회의 녹음 파일을 화자 라벨과 타임스탬프를 포함하여 녹취하세요.
이 강의 영상의 오디오를 녹취하고 지정된 민감 단어를 마스킹하세요.
프로젝트 이름을 핫워드로 사용하여 이 주간 스탠드업 회의 녹음 파일을 녹취하세요.
FAQ
Paraformer v2는 어떤 용도에 가장 적합한가요?
녹화된 회의, 인터뷰, 대화의 오프라인 녹취용입니다. 주요 오디오 및 비디오 형식을 샘플 레이트 제한 없이 허용하며, 텍스트와 함께 타임스탬프를 반환합니다.
입력 크기는 어느 정도까지 가능한가요?
Alibaba는 Paraformer 파일 모델에 대해 최대 2GB 및 12시간 분량의 파일을 문서화하고 있습니다. 이보다 긴 파일은 녹취를 제출하기 전에 분할하십시오.
타임스탬프를 끌 수 있나요?
아니요. Alibaba는 Paraformer에서 타임스탬프가 항상 활성화되어 있다고 명시하고 있으므로, 모든 녹취록에 타임스탬프가 포함되며 시간 위치를 얻기 위한 별도의 요청 옵션은 필요하지 않습니다.
Paraformer v2와 Fun-ASR 중 무엇을 선택해야 하나요?
둘 다 화자 분리와 핫워드 기능을 사용하여 파일을 녹취합니다. Fun-ASR은 더 새로운 라인업이며, Paraformer v2는 검증된 모델입니다. 각 모델에 오디오 샘플을 실행해 보고 본인에게 중요한 오류를 비교해 보십시오.
Paraformer v2 의 가격은 얼마인가요?
TokenLab 에서 Paraformer v2 은 $0.00001176 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Paraformer v2 은 어떤 엔드포인트를 써야 하나요?
Paraformer v2에 대해 https://api.tokenlab.sh/v1/audio/transcriptions를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Paraformer v2 은 어떤 오퍼레이션을 지원하나요?
Paraformer v2은(는) 음성-텍스트 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Paraformer v2 비교하기
출처
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
2026. 10. 2. 검토 완료