각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

xAI: Grok STT

Grok STT는 업로드된 녹음 파일을 위한 xAI의 음성-텍스트 변환 서비스입니다. 이 통합 모델은 보고된 오디오 재생 시간과 함께 일괄 전사 기능을 제공하며, 실시간 스트리밍 서비스는 별도의 인터페이스와 가격 계약을 사용합니다.
모델 비교
grok-stt
사용 가능xAI음성 인식(STT)동기
가격
부터 $0.000028
모달리티
오디오

Grok STT 소개

Grok STT는 녹음된 오디오를 텍스트로 변환하는 xAI의 음성 인식(STT) 서비스입니다. 이 모델은 업로드된 녹음 파일을 일괄 처리하여 JSON 형식의 녹취록을 반환합니다. xAI는 자사 전사 서비스에서 25개 언어를 지원한다고 명시하고 있습니다. 실시간 스트리밍 전사는 별도의 xAI 인터페이스를 통해 제공되므로, 이 모델은 회의, 통화, 인터뷰와 같이 이미 존재하는 파일 처리에 적합합니다.

강점

  • 업로드된 오디오 파일을 한 번의 요청으로 전사하여 JSON 결과로 반환합니다.
  • xAI는 25개 언어 지원을 명시하고 있으며, 다양한 다국어 녹음 파일을 처리할 수 있습니다.
  • 회의 아카이브, 통화 녹음, 인터뷰 백로그와 같은 일괄 작업에 적합합니다.
  • 표준 오디오 전사 요청 형식을 따르므로, 기존 Whisper 스타일 클라이언트는 거의 수정할 필요가 없습니다.
  • 긴 녹음 파일은 짧은 조각으로 나누지 않고 단일 파일 업로드로 처리합니다.

다른 모델이 필요한 경우

  • 일괄 처리 전용입니다. 라이브 자막 및 저지연 스트리밍은 별도의 실시간 인터페이스가 필요합니다.
  • 출력물은 JSON 형식의 녹취록이며, 요약이나 번역 기능은 내장되어 있지 않습니다.
  • 정확도는 오디오 품질에 따라 달라지므로, 소음이 심하거나 겹쳐 말하는 음성은 정리나 검토가 필요할 수 있습니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    음성-텍스트 변환TokenLab 엔드포인트
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

가격 책정

Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.

음성-텍스트 변환

초당
Official 가격
$0.00002778
Official
$0.00002778
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Grok STT을 열고 프롬프트를 수정하거나 전송하세요.

/v1/audio/transcriptions에서 grok-stt로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.

사용 사례

  • 회의 녹취록

    녹음된 통화나 회의를 업로드하고 텍스트로 저장하여 팀이 검색하거나 요약 모델에 입력할 수 있도록 합니다.

  • 인터뷰 및 팟캐스트 아카이브

    편집, 인용, 쇼 노트 작성을 위해 쌓여 있는 녹음 파일을 텍스트로 변환합니다.

  • 고객 상담 검토

    고객 통화를 대량으로 전사하여 품질 관리 팀이 문제점과 주요 주제를 파악할 수 있도록 합니다.

프롬프트 예제

이 45분짜리 팀 회의 녹음 파일을 영어로 전사해 주세요.

첨부된 고객 통화 내용을 전사해 주세요. 화자는 스페인어로 말합니다.

이 녹음된 강의를 텍스트로 변환하여 광합성 섹션을 검색할 수 있게 해 주세요.

FAQ

Grok STT란 무엇인가요?

xAI의 음성 인식 서비스입니다. 업로드된 녹음 파일을 받아 JSON 형식의 녹취록을 반환하며, 실시간이 아닌 일괄 처리 방식으로 작동합니다. 회의, 통화, 인터뷰 등 이미 보유하고 있는 녹음 파일에 사용하세요.

어떤 언어를 지원하나요?

xAI는 전사 서비스에서 25개 언어를 지원한다고 명시합니다. 언어와 녹음 품질에 따라 정확도가 달라질 수 있으므로, 먼저 짧은 샘플로 테스트해 보세요. 억양 또한 결과에 영향을 미칩니다.

Grok STT로 실시간 오디오를 전사할 수 있나요?

아니요. 업로드된 파일만 처리하므로 통화나 회의가 종료된 후에 사용하세요. xAI는 별도의 인터페이스를 통해 스트리밍 전사를 제공하며, 라이브 자막 기능은 이 모델이 아닌 해당 인터페이스가 필요합니다.

어떤 형식으로 결과가 나오나요?

전사된 텍스트가 포함된 JSON 응답입니다. 해당 텍스트를 언어 모델에 전달하여 요약, 작업 항목 추출 또는 다른 언어로의 번역에 활용할 수 있습니다.

Whisper와는 어떻게 다른가요?

둘 다 동일한 요청 방식으로 업로드된 오디오를 전사합니다. 언어 지원 범위와 오디오 유형별 정확도에서 차이가 있으므로, 보유한 녹음 파일 샘플을 양쪽 모두에 실행하여 녹취록을 비교해 보세요.

Grok STT 의 가격은 얼마인가요?

TokenLab 에서 Grok STT 은 $0.00002778 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Grok STT 은 어떤 엔드포인트를 써야 하나요?

Grok STT에 대해 https://api.tokenlab.sh/v1/audio/transcriptions를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Grok STT 은 어떤 오퍼레이션을 지원하나요?

Grok STT은(는) 음성-텍스트 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Grok STT 비교하기

출처

2026. 10. 2. 검토 완료

Grok Voice의 다른 모델

관련 모델