각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0은 실시간 대화를 위한 음성 모델입니다. 어시스턴트가 단순히 준비된 스크립트를 읽는 것이 아니라 진행 중인 대화의 흐름을 따라가야 하는 음성 인터페이스에 적합합니다.
모델 비교
grok-voice-think-fast-2.0
사용 가능xAI오디오동기
가격
부터 $0.001333
모달리티
오디오

Grok Voice Think Fast 2.0 소개

Grok Voice Think Fast 2.0은 xAI의 실시간 음성 모델로, 준비된 대본을 읽는 것이 아니라 화자의 속도에 맞춰야 하는 어시스턴트를 위해 설계된 양방향 실시간 대화용 모델입니다. 이 모델은 grok-voice-latest 별칭 뒤에 있는 버전 관리 모델입니다. 제품에서 음성 응답을 위해 고정된 모델 버전이 필요할 때 이 정확한 ID를 사용하십시오.

강점

  • xAI 음성 에이전트 별칭 뒤에 있는 고정된 버전 관리 릴리스이므로, 사용자가 변경하기 전까지는 동일한 모델의 동작이 유지됩니다.
  • 서버 측 음성 활동 감지 기능이 턴테이킹(turn-taking)을 관리하므로, 클라이언트는 자체적인 일시 중지 로직 없이 마이크 오디오를 스트리밍합니다.
  • 응답별 지침을 통해 세션 중에 단일 응답에 대한 시스템 프롬프트를 변경할 수 있습니다. 예를 들어, 환불 설명 시 어조를 변경하는 데 사용할 수 있습니다.
  • 발음 대체 기능을 사용하면 대본을 변경하지 않고도 이름이나 제품 용어가 발음되는 방식을 수정할 수 있습니다.

다른 모델이 필요한 경우

  • 대화형 음성-음성(speech-to-speech) 모델이므로, 파일의 일괄 전사나 긴 텍스트의 내레이션은 전용 음성 모델을 사용하는 것이 더 적합합니다.
  • 실시간 오디오를 위해 연결을 유지하려면 WebSocket 클라이언트가 필요합니다. 일반적인 요청 및 응답 호출로는 구동되지 않습니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    오디오Chat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

가격 책정

Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.

Audio Duration

초당
Official 가격
$0.001333
Official
$0.001333
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

사용 사례

  • 대화형 음성 응답(IVR) 대체

    메뉴 기반의 전화 자동 응답 시스템을 사용자가 문제를 간단히 말하면 에이전트가 통화를 연결하거나 해결해 주는 방식으로 대체합니다.

  • 언어 연습 파트너

    목표 언어로 구어체 대화를 나누며, 학습자의 요청에 따라 실수를 소리 내어 교정하고 속도를 조절합니다.

  • 핸즈프리 현장 어시스턴트

    기술자가 양손을 장비에 둔 상태에서 음성으로 매뉴얼에 관한 질문을 하고 답변을 들을 수 있도록 합니다.

프롬프트 예제

당신은 인터넷 서비스 제공업체의 차분한 지원 상담원입니다. 계정 우편번호를 물어본 다음, 발신자에게 라우터 재시작 방법을 안내하십시오.

우리 브랜드 'Zyntra'를 ZIN-tra로 발음하고, 친절한 어조를 유지하며, 발신자의 말을 중간에 끊지 마십시오.

포르투갈어 튜터 역할을 하십시오. 천천히 말하고, 내가 말한 문장을 교정하여 반복하며, 매 턴마다 후속 질문을 하나씩 하십시오.

FAQ

grok-voice-think-fast-2.0과 grok-voice-latest의 차이점은 무엇인가요?

grok-voice-think-fast-2.0은 특정 모델 버전이며, grok-voice-latest는 현재 해당 버전을 가리키는 별칭입니다. 별칭은 더 새로운 릴리스로 이동하지만, 날짜가 포함된 이름은 테스트한 버전에 그대로 유지됩니다.

Grok Voice Think Fast 2.0은 텍스트-음성 변환(TTS) 모델인가요?

아니요. 이 모델은 실시간 세션에서 듣고 대답하며, 오디오를 입력받아 음성 응답을 생성합니다. 준비된 텍스트를 오디오로 변환하려면 Grok Voice TTS를 사용하고, 녹음 내용을 전사하려면 Grok Voice STT를 사용하십시오.

사용자가 말을 마쳤는지 어떻게 결정하나요?

세션에서 서버 측 음성 활동 감지 기능을 활성화하면 사용자 턴의 종료를 감지하고 응답을 시작합니다. 클라이언트에 이미 푸시 투 토크(push-to-talk) 기능이 있는 경우 직접 턴을 관리할 수도 있습니다.

어떤 음성을 사용할 수 있나요?

세션에서 xAI의 내장 음성(기본값은 eve) 중 하나를 선택하거나, 짧은 참조 녹음에서 복제한 사용자 지정 음성을 선택할 수 있습니다. 내장 음성은 지원되는 모든 언어를 말할 수 있습니다.

Grok Voice Think Fast 2.0 의 가격은 얼마인가요?

TokenLab 에서 Grok Voice Think Fast 2.0 은 $0.001333 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Grok Voice Think Fast 2.0 은 어떤 엔드포인트를 써야 하나요?

Grok Voice Think Fast 2.0에 대해 https://api.tokenlab.sh/v1/chat/completions를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Grok Voice Think Fast 2.0 비교하기

출처

2026. 10. 2. 검토 완료

Grok Voice의 다른 모델

관련 모델