xAI: Grok Voice TTS
grok-voice-tts- 입력 / 출력
- $15.00 / $0.00
- 모달리티
- 오디오
Grok Voice TTS 소개
Grok Voice TTS는 xAI의 텍스트-음성 변환 모델로, 작성된 텍스트를 선택한 음성과 언어로 음성 오디오로 렌더링합니다. 일시 중지, 웃음, 속삭임과 같은 인라인 태그가 전달 방식을 결정합니다. 내레이션, 음성 알림, 그리고 실시간 대화가 필요 없는 현지화된 음성 답변 등에 사용하십시오.
강점
- [pause] 및 [laugh]와 같은 인라인 음성 태그와 whisper와 같은 래핑 태그를 사용하여 텍스트 내에서 전달 방식을 제어할 수 있습니다.
- 내장 음성은 모두 지원되는 언어를 말할 수 있으므로, 하나의 음성 정체성을 동일한 콘텐츠의 현지화된 버전 전체에 걸쳐 사용할 수 있습니다.
- 사용자 지정 음성은 브랜드나 캐릭터 음성을 위해 짧은 참조 클립에서 복제할 수 있습니다.
- 자막이나 입 모양을 오디오와 동기화하기 위해 문자 단위의 타임스탬프를 반환받을 수 있습니다.
다른 모델이 필요한 경우
- 이 모델은 고정된 텍스트를 말합니다. 사용자가 말을 끊거나 대답해야 하는 경우에는 대화형 음성 모델이 필요합니다.
- 긴 대본의 출력 품질은 원문 텍스트의 구두점과 태그에 따라 달라지므로, 편집되지 않은 기계 텍스트는 단조롭게 들릴 수 있습니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
텍스트 음성 변환TokenLab 엔드포인트POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
가격 책정
100만 문자당- Official
- 입력$15.00/100만 자출력$0.00/100만 자
- Official 가격
- 입력$15.00/100만 자출력$0.00/100만 자
| Official 가격100만 문자당 | Official100만 문자당 | 할인 | |
|---|---|---|---|
| 입력 | $15.00 | $15.00 | — |
| 출력 | $0.00 | $0.00 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Grok Voice TTS을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/speech에서 grok-voice-tts로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
내레이션된 기사 및 강의
완성된 기사나 강의 대본을 오디오 트랙으로 변환하고, 일시 중지를 사용하여 섹션을 구분합니다.
음성 알림
전화 코덱을 통해 사용자의 언어로 주문 업데이트나 안전 공지 사항을 읽어줍니다.
현지화된 제품 영상
선택한 하나의 음성으로 여러 언어의 동일한 대본을 음성으로 변환한 다음, 타임스탬프를 사용하여 자막을 맞춥니다.
프롬프트 예제
이 문단을 따뜻하고 안정적인 목소리로 읽고, 각 문장 뒤에 짧은 [pause]를 추가하십시오.
다음 공지 사항을 프랑스어로 말한 다음, 동일한 음성을 사용하여 독일어로 반복하십시오.
<whisper>고객님의 택배가 발송되었습니다.</whisper> [pause] 목요일에 도착할 예정입니다.
FAQ
Grok Voice TTS는 어떤 기능을 하나요?
텍스트를 음성 오디오로 변환합니다. 음성, 언어 코드(선택 사항), 출력 형식을 선택하면 텍스트에 대한 오디오를 반환하며, 여기에는 인라인으로 작성한 표현 태그도 포함됩니다.
어떤 오디오 형식을 생성할 수 있나요?
MP3, WAV, 원시 PCM과 전화 코덱인 mu-law 및 A-law를 지원하며, 샘플링 속도는 8kHz에서 48kHz까지 가능합니다. 전화 코덱은 전화 시스템에 적합하며, MP3는 웹 및 모바일 재생에 적합합니다.
몇 개의 언어를 말할 수 있나요?
xAI는 BCP-47 코드로 선택된 20개 언어를 문서화하고 있으며, 대안으로 자동 언어 감지 기능을 제공합니다. 각 내장 음성은 지원되는 모든 언어를 말할 수 있으므로 언어를 변경하기 위해 새로운 음성이 필요하지 않습니다.
텍스트가 도착하는 동안 오디오를 스트리밍할 수 있나요?
네. WebSocket 엔드포인트는 텍스트가 전송되는 즉시 실시간으로 오디오를 생성하므로, 다른 모델이 아직 말할 응답을 작성 중일 때 유용합니다.
잘못 발음된 단어를 수정할 수 있나요?
네. 발음 대체 기능을 사용하면 작성된 용어를 올바른 발음으로 매핑할 수 있으므로, 표시되는 텍스트를 편집하지 않고도 브랜드 이름이나 약어를 정확하게 발음할 수 있습니다.
Grok Voice TTS 의 가격은 얼마인가요?
TokenLab 에서 Grok Voice TTS 은 입력 $15.00 / 출력 $0.00 100만 문자당 입니다. 자세한 내역은 위 가격 표를 확인하세요.
Grok Voice TTS 은 어떤 엔드포인트를 써야 하나요?
Grok Voice TTS에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Grok Voice TTS 은 어떤 오퍼레이션을 지원하나요?
Grok Voice TTS은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Grok Voice TTS 비교하기
출처
2026. 10. 2. 검토 완료