Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- 가격
- 부터 $0.000015
- 모달리티
- 오디오
Qwen3-TTS 1.7B VoiceDesign 소개
Qwen3-TTS 1.7B VoiceDesign은 사전 설정 목록 대신 서면 설명으로부터 음성을 생성하는 알리바바의 텍스트 음성 변환 변형 모델입니다. 자연어로 감정, 톤, 운율을 설명하면 모델이 해당 음성으로 텍스트를 읽습니다. 10개 언어를 지원하며 기존 화자가 캐릭터나 브랜드에 맞지 않는 경우에 적합합니다.
강점
- 음성은 고정된 목록에서 선택하는 대신 '느리고 따뜻한 말투의 노년 내레이터'와 같은 설명으로 정의됩니다.
- 음색, 감정, 운율은 모두 지침을 통해 조절할 수 있으며, 분노와 같은 강한 감정도 포함됩니다.
- 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어와 방언 변형을 지원합니다.
- 알리바바는 Qwen3-TTS 제품군의 합성 지연 시간이 약 97ms로 낮아 대화형 사용에 적합하다고 명시합니다.
다른 모델이 필요한 경우
- 동일한 설명이라도 호출할 때마다 음성이 약간 다를 수 있으므로, 몇 달 동안 정확히 동일한 음성을 반복해야 하는 경우에는 적합하지 않습니다.
- 고정된 이름의 화자를 원한다면 9개의 프리미엄 화자가 있는 CustomVoice 변형이 더 예측 가능합니다.
- 품질은 음성을 얼마나 명확하게 설명하느냐에 달려 있으며, 모호한 설명은 일반적인 결과를 낳습니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
텍스트 음성 변환TokenLab 엔드포인트POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
텍스트 음성 변환
100만 문자당- Official 가격
- $0.000015
- Official
- $0.000015
- 할인
- —
| Official 가격100만 문자당 | Official100만 문자당 | 할인 | |
|---|---|---|---|
| 텍스트 음성 변환 | $0.000015 | $0.000015 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Qwen3-TTS 1.7B VoiceDesign을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/speech에서 qwen3-tts-1-7b-voicedesign로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
게임 캐릭터 음성
예를 들어 '퉁명스러운 드워프 대장장이'나 '긴장한 젊은 전령'처럼 각 캐릭터를 설명하고 성우를 섭외하지 않고도 대사를 생성합니다.
브랜드 음성 탐색
'자신감 있고 낮은 톤' 대 '밝고 빠른 톤'과 같이 회사 음성에 대한 여러 설명을 시도하고 동일한 스크립트로 비교합니다.
표현력이 풍부한 내레이션
하나의 프로젝트 내에서 '낮고 긴장된' 상태에서 '안도하고 따뜻한' 상태로 변하는 등 스토리 섹션에 맞는 전달력을 지시합니다.
영상용 프로토타입 음성
최종 성우를 캐스팅하기 전에 스토리보드나 설명 영상을 위한 임시 내레이터를 생성합니다.
프롬프트 예제
음성: 중년 여성, 차분하고 낮은 톤, 다큐멘터리 내레이터처럼 천천히 말함. 텍스트: The river has changed course three times in the last century.
음성: 젊은 남성, 신나고 약간 숨이 찬 듯한, 빠른 속도. 텍스트: You will not believe what just came through the door.
음성: 매우 화난 어조로, 빠르고 딱딱 끊어서 말함. 텍스트: 这已经是第三次了,你们到底有没有在听?
FAQ
Qwen3-TTS VoiceDesign은 무엇을 위한 것인가요?
말로 지정한 음성으로 음성을 생성합니다. 이름이 지정된 화자를 선택하는 대신 감정, 톤, 전달 방식을 설명하는 글을 작성하면 모델이 그에 따른 오디오를 생성합니다. 기존 프리미엄 화자와 맞지 않는 캐릭터나 브랜드 음성에 적합합니다.
CustomVoice와 어떻게 다른가요?
CustomVoice는 선택 가능한 9개의 고정된 화자를 제공합니다. VoiceDesign은 고정된 목록이 없으며 설명에 따라 음성을 구축합니다. 새로운 것을 만들려면 VoiceDesign을, 안정적이고 반복 가능한 화자가 필요하면 CustomVoice를 선택하세요.
어떤 언어가 지원되나요?
중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어와 일부 방언 변형을 지원합니다. 모델이 이해할 수 있는 언어로 음성을 설명하세요. 모델 카드의 예시는 중국어를 사용합니다.
실제 사람의 음성을 복제할 수 있나요?
Qwen3-TTS 제품군은 짧은 샘플을 통한 음성 복제를 설명하지만, 이 변형 모델은 지침 기반 설계에 중점을 둡니다. 허가받은 음성만 복제하거나 모방하고, 출력 결과가 자체 동의 규칙을 준수하는지 확인하십시오.
모든 호출에서 음성이 동일한가요?
보장되지 않습니다. 설명은 음성을 유도하지만 정확한 음색을 고정하지는 않으므로 반복 호출 시 약간 다르게 들릴 수 있습니다. 긴 프로젝트 전반에 걸쳐 정확한 반복이 필요하다면 고정된 프리미엄 화자를 사용하십시오.
Qwen3-TTS 1.7B VoiceDesign 의 가격은 얼마인가요?
TokenLab 에서 Qwen3-TTS 1.7B VoiceDesign 은 - 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Qwen3-TTS 1.7B VoiceDesign 은 어떤 엔드포인트를 써야 하나요?
Qwen3-TTS 1.7B VoiceDesign에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Qwen3-TTS 1.7B VoiceDesign 은 어떤 오퍼레이션을 지원하나요?
Qwen3-TTS 1.7B VoiceDesign은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Qwen3-TTS 1.7B VoiceDesign 비교하기
출처
2026. 10. 2. 검토 완료