Alibaba: Qwen3-TTS 1.7B CustomVoice
qwen3-tts-1-7b-customvoice- 가격
- 부터 $0.000015
- 모달리티
- 오디오
Qwen3-TTS 1.7B CustomVoice 소개
Qwen3-TTS 1.7B CustomVoice는 9개의 고정된 사전 설정 음성을 기반으로 하는 알리바바의 텍스트 음성 변환(TTS) 모델입니다. 이름으로 화자를 선택하고 톤, 감정, 말하기 방식에 대한 자연어 지침을 추가할 수 있습니다. 한국어, 중국어, 영어, 일본어를 포함한 10개 언어와 여러 유럽 언어를 지원하며, 알리바바는 대화형 사용을 위한 종단간(end-to-end) 합성 지연 시간이 97ms까지 낮다고 밝히고 있습니다.
강점
- 이름이 지정된 9개의 프리미엄 화자는 다양한 성별, 연령, 언어 및 방언을 포괄하므로 전체 제품에서 일관된 음성을 유지할 수 있습니다.
- 선택한 화자를 변경하지 않고도 서면 지침을 통해 감정과 말하기 방식을 조절할 수 있습니다.
- 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 지원합니다.
- 알리바바는 종단간 지연 시간이 97ms까지 낮다고 보고했으며, 이는 음성 비서 및 실시간 내레이션에 적합합니다.
다른 모델이 필요한 경우
- 음성 목록은 고정되어 있습니다. 설명으로부터 새로운 음성을 생성하려면 VoiceDesign 변형 모델이 더 적합합니다.
- 화자가 자신의 모국어를 읽을 때 결과가 가장 좋으며, 영어 프리미엄 화자가 일본어를 읽을 경우 억양이 섞일 수 있습니다.
- 복잡한 마크업이나 혼합된 기호와 같이 소음이 많거나 비정상적인 입력 텍스트는 출력 품질을 저하시킬 수 있습니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
텍스트 음성 변환TokenLab 엔드포인트POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-customvoice", "input": "Hello from TokenLab.", "voice": "alloy" }'
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
텍스트 음성 변환
100만 문자당- Official 가격
- $0.000015
- Official
- $0.000015
- 할인
- —
| Official 가격100만 문자당 | Official100만 문자당 | 할인 | |
|---|---|---|---|
| 텍스트 음성 변환 | $0.000015 | $0.000015 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Qwen3-TTS 1.7B CustomVoice을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/speech에서 qwen3-tts-1-7b-customvoice로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
음성 비서
앱 내 비서에게 고정된 이름의 음성을 부여하고 응답 지연 시간을 낮춰 텍스트가 준비된 후 즉시 응답이 재생되도록 합니다.
오디오북 및 기사 내레이션
선택한 화자로 긴 텍스트를 읽고 '차분하고 따뜻하게'와 같은 지침을 추가하여 챕터 전반에 걸쳐 일관된 전달력을 유지합니다.
현지화된 제품 영상
일본어, 한국어 또는 영어 프리미엄 화자를 사용하여 각 시장별로 동일한 스크립트를 음성으로 변환하면서 브랜드의 인지 가능한 음색을 유지합니다.
게임 및 캐릭터 대사
캐릭터마다 고유한 프리미엄 화자를 선택하고 화난, 피곤한, 신난 등의 감정 지침을 추가합니다.
프롬프트 예제
화자: Ryan. 지침: 차분하고 친절하며 약간 느리게. 텍스트: Welcome back. Your order has shipped and should arrive on Thursday.
화자: Ono_Anna. 지침: 쾌활한 아나운서. 텍스트: 本日はご来店いただき、ありがとうございます。
화자: Vivian. 지침: 비밀을 말하는 것처럼 속삭임. 텍스트: 你听说了吗?明天会有一个大消息。
FAQ
Qwen3-TTS CustomVoice는 어떤 음성을 제공하나요?
9개의 프리미엄 화자: 중국어 변형을 위한 Vivian, Serena, Uncle_Fu, Dylan, Eric, 영어용 Ryan과 Aiden, 일본어용 Ono_Anna, 한국어용 Sohee가 있습니다. 요청 시 이름으로 하나를 선택합니다.
감정과 말하기 방식을 제어할 수 있나요?
네. '화난', '부드러운', '빠르고 신난'과 같은 자연어 지침을 추가하면 모델이 선택된 화자의 음색을 유지하면서 톤과 방식을 조정합니다.
CustomVoice와 VoiceDesign은 어떻게 다른가요?
CustomVoice는 선택 가능한 9개의 고정된 화자를 사용합니다. VoiceDesign은 사전 설정 목록이 없으며, 연령, 분위기, 운율 등 원하는 음성을 말로 설명하면 모델이 이를 생성합니다. 일관성을 위해서는 CustomVoice를, 새로운 음성을 만들려면 VoiceDesign을 선택하세요.
어떤 언어를 말할 수 있나요?
중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어입니다. 모델 카드는 최상의 품질을 위해 각 화자를 모국어로 사용하는 것을 권장합니다.
실시간 대화에 충분히 빠른가요?
알리바바는 실시간 사용을 목표로 종단간 합성 지연 시간이 97ms까지 낮다고 명시합니다. 앱에서의 실제 지연 시간은 네트워크 거리와 텍스트 길이에 따라 달라지므로 자체 트래픽으로 측정하십시오.
Qwen3-TTS 1.7B CustomVoice 의 가격은 얼마인가요?
TokenLab 에서 Qwen3-TTS 1.7B CustomVoice 은 - 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Qwen3-TTS 1.7B CustomVoice 은 어떤 엔드포인트를 써야 하나요?
Qwen3-TTS 1.7B CustomVoice에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Qwen3-TTS 1.7B CustomVoice 은 어떤 오퍼레이션을 지원하나요?
Qwen3-TTS 1.7B CustomVoice은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Qwen3-TTS 1.7B CustomVoice 비교하기
출처
2026. 10. 2. 검토 완료