각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus는 작성된 스크립트를 표현력이 풍부한 음성으로 변환합니다. 내레이션 기사, 대화형 보이스오버, 음성 제품 안내 등에 사용하며, 청중에게 적합한 음성과 말하기 속도를 선택할 수 있습니다.
모델 비교
cosyvoice-v3.5-plus
사용 가능Alibaba텍스트 음성 변환동기
입력 / 출력
$22.06 / $0.00
모달리티
오디오

CosyVoice v3.5 Plus 소개

CosyVoice v3.5 Plus는 사용자가 직접 만드는 음성을 위한 Alibaba의 음성 합성 모델입니다. 기본 제공 음성 목록은 없으며, 샘플에서 음성을 복제하거나 텍스트 설명으로 음성을 설계한 후 WebSocket 연결을 통해 합성합니다. 만다린어, 영어 및 기타 여러 언어와 다양한 중국 방언을 구사하며, 자연어 지시를 통해 발화 방식을 제어할 수 있습니다(Qwen3-TTS-Flash에는 없는 기능).

강점

  • 녹음된 샘플에서 복제한 음성이나 텍스트 설명으로 설계한 음성을 사용할 수 있습니다.
  • 톤과 말하기 스타일을 제어하는 지시 사항을 입력받습니다.
  • 만다린어, 광둥어, 다양한 중국 방언뿐만 아니라 영어, 프랑스어, 독일어, 일본어, 한국어, 러시아어, 포르투갈어, 태국어, 인도네시아어, 베트남어를 구사합니다.
  • WebSocket을 통해 오디오를 스트리밍하므로 합성이 완료되기 전에 재생을 시작할 수 있습니다.

다른 모델이 필요한 경우

  • 내장된 시스템 음성이 없으므로, 먼저 음성을 복제하거나 설계해야 합니다.
  • 단순 HTTP 요청이 아닌 WebSocket 클라이언트가 필요합니다.
  • 음성 복제를 위해서는 깨끗한 참조 샘플과 해당 음성 사용에 대한 동의가 필요합니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트 음성 변환TokenLab 엔드포인트
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

가격 책정

Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.

Cosy Tts Number

100만 문자당
Official 가격
입력 $22.06 / 출력 $0.00
Official
입력 $22.06 / 출력 $0.00
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 CosyVoice v3.5 Plus을 열고 프롬프트를 수정하거나 전송하세요.

/v1/audio/speech에서 cosyvoice-v3.5-plus로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.

사용 사례

  • 브랜드 음성

    승인된 화자의 음성을 한 번 복제하여 제품 소개, IVR 안내, 공지 사항 등에 사용합니다.

  • 캐릭터 음성

    오디오북이나 게임을 위해 '따뜻한 노년의 이야기꾼'과 같이 설명에 기반한 음성을 설계합니다.

  • 지역 방언 내레이션

    쓰촨어, 상하이어, 광둥어 등으로 현지 청중을 위한 음성 콘텐츠를 제작합니다.

프롬프트 예제

이 공지 사항을 활기차고 밝은 톤으로 읽어주고, 날짜 뒤에는 짧게 멈춰주세요.

다음 단락을 마치 잠자리 동화를 읽어주듯이 느리고 따뜻하게 말해주세요.

이 내용을 광둥어로 편안하고 대화하듯 말해주세요.

FAQ

CosyVoice v3.5 Plus에 사전 설정된 음성이 있나요?

아니요. Alibaba는 이 모델에 대해 시스템 음성을 제공하지 않습니다. 샘플에서 복제하거나 텍스트 설명으로 설계한 음성이 필요하며, 합성 시 해당 음성을 전달해야 합니다.

어떤 언어와 방언을 지원하나요?

만다린어, 광둥어, 다양한 중국 방언과 영어, 프랑스어, 독일어, 일본어, 한국어, 러시아어, 포르투갈어, 태국어, 인도네시아어, 베트남어를 지원합니다. 방언 지원 여부는 Qwen3-TTS-Flash 모델과의 주요 차이점입니다.

음성을 제어할 수 있나요?

네. 이 모델은 지시 제어를 지원하므로 자연어로 톤, 감정, 속도를 설명할 수 있습니다. 음성 선택은 누가 말할지를 결정하고, 지시 사항은 어떻게 말할지를 결정합니다.

어떻게 호출하나요?

생성되는 오디오를 실시간으로 스트리밍하는 WebSocket API를 통해 호출합니다. 긴 스크립트와 실시간 재생에 적합하지만, 연결을 처리할 클라이언트가 필요합니다.

Qwen3-TTS-Flash는 언제 선택해야 하나요?

준비된 음성을 사용하고 싶고, 복제나 지시 사항 없이 간단한 HTTP 호출을 원할 때 선택하세요. 음성 정체성이나 전달 스타일이 제품의 핵심 요소라면 CosyVoice를 선택하세요.

CosyVoice v3.5 Plus 의 가격은 얼마인가요?

TokenLab 에서 CosyVoice v3.5 Plus 은 입력 $22.06 / 출력 $0.00 100만 문자당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

CosyVoice v3.5 Plus 은 어떤 엔드포인트를 써야 하나요?

CosyVoice v3.5 Plus에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

CosyVoice v3.5 Plus 은 어떤 오퍼레이션을 지원하나요?

CosyVoice v3.5 Plus은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

CosyVoice v3.5 Plus 비교하기

출처

2026. 10. 2. 검토 완료

관련 모델