xAI: Grok STT
grok-stt- 가격
- 부터 $0.000028
- 모달리티
- 오디오
Grok STT 소개
Grok STT는 녹음된 오디오를 텍스트로 변환하는 xAI의 음성 인식(STT) 서비스입니다. 이 모델은 업로드된 녹음 파일을 일괄 처리하여 JSON 형식의 녹취록을 반환합니다. xAI는 자사 전사 서비스에서 25개 언어를 지원한다고 명시하고 있습니다. 실시간 스트리밍 전사는 별도의 xAI 인터페이스를 통해 제공되므로, 이 모델은 회의, 통화, 인터뷰와 같이 이미 존재하는 파일 처리에 적합합니다.
강점
- 업로드된 오디오 파일을 한 번의 요청으로 전사하여 JSON 결과로 반환합니다.
- xAI는 25개 언어 지원을 명시하고 있으며, 다양한 다국어 녹음 파일을 처리할 수 있습니다.
- 회의 아카이브, 통화 녹음, 인터뷰 백로그와 같은 일괄 작업에 적합합니다.
- 표준 오디오 전사 요청 형식을 따르므로, 기존 Whisper 스타일 클라이언트는 거의 수정할 필요가 없습니다.
- 긴 녹음 파일은 짧은 조각으로 나누지 않고 단일 파일 업로드로 처리합니다.
다른 모델이 필요한 경우
- 일괄 처리 전용입니다. 라이브 자막 및 저지연 스트리밍은 별도의 실시간 인터페이스가 필요합니다.
- 출력물은 JSON 형식의 녹취록이며, 요약이나 번역 기능은 내장되어 있지 않습니다.
- 정확도는 오디오 품질에 따라 달라지므로, 소음이 심하거나 겹쳐 말하는 음성은 정리나 검토가 필요할 수 있습니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
음성-텍스트 변환TokenLab 엔드포인트POST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-stt" \ -F language="en"
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
음성-텍스트 변환
초당- Official 가격
- $0.00002778
- Official
- $0.00002778
- 할인
- —
| Official 가격초당 | Official초당 | 할인 | |
|---|---|---|---|
| 음성-텍스트 변환 | $0.00002778 | $0.00002778 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Grok STT을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/transcriptions에서 grok-stt로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
회의 녹취록
녹음된 통화나 회의를 업로드하고 텍스트로 저장하여 팀이 검색하거나 요약 모델에 입력할 수 있도록 합니다.
인터뷰 및 팟캐스트 아카이브
편집, 인용, 쇼 노트 작성을 위해 쌓여 있는 녹음 파일을 텍스트로 변환합니다.
고객 상담 검토
고객 통화를 대량으로 전사하여 품질 관리 팀이 문제점과 주요 주제를 파악할 수 있도록 합니다.
프롬프트 예제
이 45분짜리 팀 회의 녹음 파일을 영어로 전사해 주세요.
첨부된 고객 통화 내용을 전사해 주세요. 화자는 스페인어로 말합니다.
이 녹음된 강의를 텍스트로 변환하여 광합성 섹션을 검색할 수 있게 해 주세요.
FAQ
Grok STT란 무엇인가요?
xAI의 음성 인식 서비스입니다. 업로드된 녹음 파일을 받아 JSON 형식의 녹취록을 반환하며, 실시간이 아닌 일괄 처리 방식으로 작동합니다. 회의, 통화, 인터뷰 등 이미 보유하고 있는 녹음 파일에 사용하세요.
어떤 언어를 지원하나요?
xAI는 전사 서비스에서 25개 언어를 지원한다고 명시합니다. 언어와 녹음 품질에 따라 정확도가 달라질 수 있으므로, 먼저 짧은 샘플로 테스트해 보세요. 억양 또한 결과에 영향을 미칩니다.
Grok STT로 실시간 오디오를 전사할 수 있나요?
아니요. 업로드된 파일만 처리하므로 통화나 회의가 종료된 후에 사용하세요. xAI는 별도의 인터페이스를 통해 스트리밍 전사를 제공하며, 라이브 자막 기능은 이 모델이 아닌 해당 인터페이스가 필요합니다.
어떤 형식으로 결과가 나오나요?
전사된 텍스트가 포함된 JSON 응답입니다. 해당 텍스트를 언어 모델에 전달하여 요약, 작업 항목 추출 또는 다른 언어로의 번역에 활용할 수 있습니다.
Whisper와는 어떻게 다른가요?
둘 다 동일한 요청 방식으로 업로드된 오디오를 전사합니다. 언어 지원 범위와 오디오 유형별 정확도에서 차이가 있으므로, 보유한 녹음 파일 샘플을 양쪽 모두에 실행하여 녹취록을 비교해 보세요.
Grok STT 의 가격은 얼마인가요?
TokenLab 에서 Grok STT 은 $0.00002778 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Grok STT 은 어떤 엔드포인트를 써야 하나요?
Grok STT에 대해 https://api.tokenlab.sh/v1/audio/transcriptions를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Grok STT 은 어떤 오퍼레이션을 지원하나요?
Grok STT은(는) 음성-텍스트 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Grok STT 비교하기
출처
2026. 10. 2. 검토 완료