Alibaba: Fun-ASR Realtime
fun-asr-realtime- 가격
- 부터 $0.00009
- 모달리티
- 오디오
Fun-ASR Realtime 소개
Fun-ASR Realtime은 알리바바의 스트리밍 음성 인식 모델로, 실시간 세션을 통해 오디오를 수신하고 말하는 즉시 텍스트를 반환합니다. 이 모델은 자막, 음성 입력, 통화 중 지원 등 녹음 완료를 기다릴 수 없는 상황을 위한 Fun-ASR 변형 모델입니다. 알리바바는 핫워드, 타임스탬프, 그리고 광둥어 및 사천어와 같은 방언을 포함한 중국어 지원을 명시하고 있습니다.
강점
- 화자가 말하는 동안 부분 텍스트를 스트리밍하므로 녹음이 끝날 때까지 기다리지 않고 자막이 표시됩니다.
- 알리바바 문서에 따르면 높은 정확도로 중국어 표준어와 광둥어, 사천어를 포함한 여러 방언을 인식합니다.
- 사용자 지정 핫워드를 통해 제품 관련 이름이나 용어에 대한 실시간 인식을 유도할 수 있습니다.
- 단어 및 문장 단위 타임스탬프가 스트림과 함께 제공되어 자막 정렬을 돕습니다.
다른 모델이 필요한 경우
- WebSocket 세션이 필요하므로 Fun-ASR에 녹음 파일을 업로드하는 것보다 통합 작업이 더 필요합니다.
- 실시간 디코딩은 이전 오디오를 다시 검토할 수 없으므로, 기록 보관용 정확도가 중요하다면 녹음 파일용 Fun-ASR을 사용하는 것이 더 안전합니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
음성-텍스트 변환WebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
실시간 / 음성-텍스트 변환
초당- Official 가격
- $0.00009
- Official
- $0.00009
- 할인
- —
| Official 가격초당 | Official초당 | 할인 | |
|---|---|---|---|
| 실시간 / 음성-텍스트 변환 | $0.00009 | $0.00009 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Fun-ASR Realtime을 열고 프롬프트를 수정하거나 전송하세요.
/v1/realtime에서 fun-asr-realtime로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
실시간 자막
웨비나나 행사에서 화자가 말하는 내용을 실시간으로 자막으로 표시하며, 문장이 완성될 때마다 업데이트합니다.
음성 입력
사용자가 양식이나 채팅창에 받아쓰기를 하면 말하는 즉시 텍스트가 나타나도록 합니다.
방언 인식 지원
전체 녹음을 기다릴 수 없는 앱에서 중국어 표준어 및 지역 방언으로 된 음성 요청을 처리합니다.
프롬프트 예제
중국어 제품 출시 행사에서 마이크 오디오를 스트리밍하고 문장이 끝날 때마다 자막을 출력하십시오.
광둥어로 진행되는 실시간 고객 통화를 '환불', '주문 번호'라는 핫워드를 사용하여 전사하십시오.
교육 세션을 스트리밍하고 나중에 클립으로 만들기 위해 단어 타임스탬프를 보관하십시오.
FAQ
Fun-ASR 대신 Fun-ASR Realtime을 선택해야 하는 경우는 언제인가요?
자막이나 받아쓰기처럼 오디오가 재생되는 동안 텍스트가 나타나야 할 때는 Realtime을 선택하십시오. 녹음이 완료된 상태에서 화자 분리(diarization)나 기록 보관용 정확도가 필요할 때는 녹음 파일용 Fun-ASR을 선택하십시오.
오디오를 어떻게 전송하나요?
알리바바의 DashScope SDK 또는 원시 프로토콜을 통한 스트리밍 WebSocket 세션을 사용합니다. 오디오 청크를 푸시하면 세션이 진행됨에 따라 인식된 텍스트 이벤트가 반환됩니다.
방언을 지원하나요?
네. 알리바바의 실시간 문서에는 중국어 표준어와 광둥어, 사천어 및 기타 방언이 명시되어 있으며, 이름이나 제품 용어 인식에 도움이 되는 사용자 지정 핫워드도 지원합니다. 방언은 표준 중국어와 동일한 실시간 세션 내에서 인식됩니다.
문장 사이의 침묵을 처리할 수 있나요?
네. 음성 활동 감지(VAD) 기능이 포함되어 있어 비음성 오디오를 필터링하고 문장 종료 지점을 결정합니다. 침묵 임계값은 세션 설정에서 구성할 수 있으므로 자막이 얼마나 빨리 확정될지 조정할 수 있습니다.
Fun-ASR Realtime 의 가격은 얼마인가요?
TokenLab 에서 Fun-ASR Realtime 은 $0.00009 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Fun-ASR Realtime 은 어떤 엔드포인트를 써야 하나요?
Fun-ASR Realtime에 대해 https://api.tokenlab.sh/v1/realtime를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Fun-ASR Realtime 은 어떤 오퍼레이션을 지원하나요?
Fun-ASR Realtime은(는) 음성-텍스트 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Fun-ASR Realtime 비교하기
출처
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
2026. 10. 2. 검토 완료