각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

xAI: Grok Voice STT

Grok Voice STT는 녹음된 오디오를 텍스트로 변환합니다. 언어 힌트와 타임스탬프 제어 기능을 통해 자막, 검색 또는 후속 텍스트 분석 단계에 활용될 전사 작업에 유용합니다.
모델 비교
grok-voice-stt
사용 가능xAI음성 인식(STT)동기
가격
부터 $0.000028
모달리티
오디오

Grok Voice STT 소개

Grok Voice STT는 xAI의 음성-텍스트 모델로, 녹음되거나 스트리밍되는 오디오를 텍스트 전사본으로 변환합니다. 일반적인 오디오 파일 형식을 지원하며, 단어 단위 타임스탬프를 반환하고, 화자와 채널을 분리할 수 있으며, 언어별로 숫자와 통화를 형식화합니다. 자막 생성, 검색 가능한 회의 기록, 이후 텍스트 분석을 위한 통화 전사 등에 사용하십시오.

강점

  • 단어 단위 타임스탬프를 사용하면 자막 생성, 특정 시점 이동 검색, 전사본 기반의 자막 파일 제작이 용이합니다.
  • 화자 분리(diarization) 및 다채널 전사 기능을 통해 회의나 양방향 통화 녹음에서 누가 무엇을 말했는지 구분할 수 있습니다.
  • 언어 힌트와 사용자 지정 핵심 용어 목록을 통해 제품명이나 전문 용어의 인식률을 높일 수 있습니다.
  • 텍스트 형식화 기능은 숫자, 날짜, 통화를 해당 언어의 표기법에 맞게 렌더링합니다.

다른 모델이 필요한 경우

  • 이 모델은 전사본만 생성합니다. 오디오를 요약, 번역하거나 오디오 내용에 기반해 답변하려면 이후 단계에서 텍스트 모델이 필요합니다.
  • 소음이 매우 심한 녹음의 경우, 음성 감지 임계값을 조정하거나 더 깨끗한 입력이 있어야 만족스러운 정확도를 얻을 수 있습니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    음성-텍스트 변환TokenLab 엔드포인트
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

가격 책정

Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.

가격 책정

초당
Official
$0.000028초당
Official 가격
$0.000028초당

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Grok Voice STT을 열고 프롬프트를 수정하거나 전송하세요.

/v1/audio/transcriptions에서 grok-voice-stt로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.

사용 사례

  • 회의 전사

    화자가 표시된 녹음 통화를 전사한 후, 텍스트를 요약기에 전달하여 작업 항목을 추출합니다.

  • 영상 자막

    단어 타이밍 정보를 사용하여 업로드된 영상의 오디오 트랙에서 시간 정보가 포함된 자막을 생성합니다.

  • 콜센터 품질 검토

    상담원과 고객이 별도 채널에 있는 2채널 녹음을 전사한 후, 규정 준수 문구가 포함되었는지 확인합니다.

프롬프트 예제

이 45분짜리 영어 팟캐스트 에피소드를 단어 타임스탬프와 화자 표시를 포함하여 전사하십시오.

첨부된 고객 통화 내용을 전사하십시오. 이때 'Zyntra', 'OmniPlan', 'SLA'를 핵심 용어로 사용하여 인식 정확도를 높이십시오.

이 스페인어 음성 메모를 텍스트로 변환하고 금액은 통화 형식으로 표기하십시오.

FAQ

Grok Voice STT는 어떤 기능을 하나요?

오디오를 텍스트로 변환합니다. 파일이나 스트리밍 오디오를 보내면 설정한 옵션에 따라 단어 단위 타임스탬프, 화자 라벨, 채널별 텍스트가 포함된 전사본을 반환합니다.

어떤 오디오 형식을 읽을 수 있나요?

xAI는 MP3, WAV, FLAC, Opus를 포함한 12가지 형식을 지원하며, 파일 크기 제한은 500MB입니다. Raw PCM, mu-law, A-law 오디오는 명시적인 인코딩 매개변수가 필요합니다.

실시간 전사를 지원하나요?

네. WebSocket 엔드포인트는 중간 결과를 스트리밍하며, 'Smart Turn' 턴 종료 감지 기능을 사용하여 자연스러운 일시 정지와 문장 끝을 구분함으로써 성급한 끊김을 방지합니다.

몇 개의 언어를 지원하나요?

xAI는 전사 및 언어별 형식화를 위해 25개 이상의 언어를 문서화하고 있습니다. 언어를 알고 있는 경우 언어 힌트를 전달하여 모델이 추측하지 않도록 하십시오.

화자를 구분할 수 있나요?

네, 화자 분리 기능은 녹음 내의 화자를 라벨링하며, 다채널 모드는 최대 8개의 개별 채널을 처리할 수 있어 각 당사자가 채널별로 녹음된 통화 기록에 적합합니다.

Grok Voice STT 의 가격은 얼마인가요?

TokenLab 에서 Grok Voice STT 은 $0.000028 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요.

Grok Voice STT 은 어떤 엔드포인트를 써야 하나요?

Grok Voice STT에 대해 https://api.tokenlab.sh/v1/audio/transcriptions를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Grok Voice STT 은 어떤 오퍼레이션을 지원하나요?

Grok Voice STT은(는) 음성-텍스트 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Grok Voice STT 비교하기

출처

2026. 10. 2. 검토 완료

Grok Voice의 다른 모델

관련 모델