각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice는 성별, 연령, 언어, 방언의 다양한 조합에 걸쳐 9개의 프리미엄 사전 설정 음색을 제공하는 Alibaba의 텍스트-음성 변환 모델입니다. 사용자 지침을 통해 대상 음성에 대한 정밀한 스타일 제어를 제공하고, 3초 샘플에서 음성 복제를 지원하며, 97ms의 낮은 지연 시간으로 10개 이상의 언어로 음성을 생성합니다.
모델 비교
qwen3-tts-1-7b-customvoice
사용 가능Alibaba텍스트 음성 변환동기
가격
부터 $0.000015
모달리티
오디오

Qwen3-TTS 1.7B CustomVoice 소개

Qwen3-TTS 1.7B CustomVoice는 9개의 고정된 사전 설정 음성을 기반으로 하는 알리바바의 텍스트 음성 변환(TTS) 모델입니다. 이름으로 화자를 선택하고 톤, 감정, 말하기 방식에 대한 자연어 지침을 추가할 수 있습니다. 한국어, 중국어, 영어, 일본어를 포함한 10개 언어와 여러 유럽 언어를 지원하며, 알리바바는 대화형 사용을 위한 종단간(end-to-end) 합성 지연 시간이 97ms까지 낮다고 밝히고 있습니다.

강점

  • 이름이 지정된 9개의 프리미엄 화자는 다양한 성별, 연령, 언어 및 방언을 포괄하므로 전체 제품에서 일관된 음성을 유지할 수 있습니다.
  • 선택한 화자를 변경하지 않고도 서면 지침을 통해 감정과 말하기 방식을 조절할 수 있습니다.
  • 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 지원합니다.
  • 알리바바는 종단간 지연 시간이 97ms까지 낮다고 보고했으며, 이는 음성 비서 및 실시간 내레이션에 적합합니다.

다른 모델이 필요한 경우

  • 음성 목록은 고정되어 있습니다. 설명으로부터 새로운 음성을 생성하려면 VoiceDesign 변형 모델이 더 적합합니다.
  • 화자가 자신의 모국어를 읽을 때 결과가 가장 좋으며, 영어 프리미엄 화자가 일본어를 읽을 경우 억양이 섞일 수 있습니다.
  • 복잡한 마크업이나 혼합된 기호와 같이 소음이 많거나 비정상적인 입력 텍스트는 출력 품질을 저하시킬 수 있습니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트 음성 변환TokenLab 엔드포인트
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

가격 책정

Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.

텍스트 음성 변환

100만 문자당
Official 가격
$0.000015
Official
$0.000015
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Qwen3-TTS 1.7B CustomVoice을 열고 프롬프트를 수정하거나 전송하세요.

/v1/audio/speech에서 qwen3-tts-1-7b-customvoice로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.

사용 사례

  • 음성 비서

    앱 내 비서에게 고정된 이름의 음성을 부여하고 응답 지연 시간을 낮춰 텍스트가 준비된 후 즉시 응답이 재생되도록 합니다.

  • 오디오북 및 기사 내레이션

    선택한 화자로 긴 텍스트를 읽고 '차분하고 따뜻하게'와 같은 지침을 추가하여 챕터 전반에 걸쳐 일관된 전달력을 유지합니다.

  • 현지화된 제품 영상

    일본어, 한국어 또는 영어 프리미엄 화자를 사용하여 각 시장별로 동일한 스크립트를 음성으로 변환하면서 브랜드의 인지 가능한 음색을 유지합니다.

  • 게임 및 캐릭터 대사

    캐릭터마다 고유한 프리미엄 화자를 선택하고 화난, 피곤한, 신난 등의 감정 지침을 추가합니다.

프롬프트 예제

화자: Ryan. 지침: 차분하고 친절하며 약간 느리게. 텍스트: Welcome back. Your order has shipped and should arrive on Thursday.

화자: Ono_Anna. 지침: 쾌활한 아나운서. 텍스트: 本日はご来店いただき、ありがとうございます。

화자: Vivian. 지침: 비밀을 말하는 것처럼 속삭임. 텍스트: 你听说了吗?明天会有一个大消息。

FAQ

Qwen3-TTS CustomVoice는 어떤 음성을 제공하나요?

9개의 프리미엄 화자: 중국어 변형을 위한 Vivian, Serena, Uncle_Fu, Dylan, Eric, 영어용 Ryan과 Aiden, 일본어용 Ono_Anna, 한국어용 Sohee가 있습니다. 요청 시 이름으로 하나를 선택합니다.

감정과 말하기 방식을 제어할 수 있나요?

네. '화난', '부드러운', '빠르고 신난'과 같은 자연어 지침을 추가하면 모델이 선택된 화자의 음색을 유지하면서 톤과 방식을 조정합니다.

CustomVoice와 VoiceDesign은 어떻게 다른가요?

CustomVoice는 선택 가능한 9개의 고정된 화자를 사용합니다. VoiceDesign은 사전 설정 목록이 없으며, 연령, 분위기, 운율 등 원하는 음성을 말로 설명하면 모델이 이를 생성합니다. 일관성을 위해서는 CustomVoice를, 새로운 음성을 만들려면 VoiceDesign을 선택하세요.

어떤 언어를 말할 수 있나요?

중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어입니다. 모델 카드는 최상의 품질을 위해 각 화자를 모국어로 사용하는 것을 권장합니다.

실시간 대화에 충분히 빠른가요?

알리바바는 실시간 사용을 목표로 종단간 합성 지연 시간이 97ms까지 낮다고 명시합니다. 앱에서의 실제 지연 시간은 네트워크 거리와 텍스트 길이에 따라 달라지므로 자체 트래픽으로 측정하십시오.

Qwen3-TTS 1.7B CustomVoice 의 가격은 얼마인가요?

TokenLab 에서 Qwen3-TTS 1.7B CustomVoice 은 - 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Qwen3-TTS 1.7B CustomVoice 은 어떤 엔드포인트를 써야 하나요?

Qwen3-TTS 1.7B CustomVoice에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Qwen3-TTS 1.7B CustomVoice 은 어떤 오퍼레이션을 지원하나요?

Qwen3-TTS 1.7B CustomVoice은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Qwen3-TTS 1.7B CustomVoice 비교하기

출처

2026. 10. 2. 검토 완료

Qwen TTS의 다른 모델

관련 모델