Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- 입력 / 출력
- $22.06 / $0.00
- 모달리티
- 오디오
CosyVoice v3.5 Plus 소개
CosyVoice v3.5 Plus는 사용자가 직접 만드는 음성을 위한 Alibaba의 음성 합성 모델입니다. 기본 제공 음성 목록은 없으며, 샘플에서 음성을 복제하거나 텍스트 설명으로 음성을 설계한 후 WebSocket 연결을 통해 합성합니다. 만다린어, 영어 및 기타 여러 언어와 다양한 중국 방언을 구사하며, 자연어 지시를 통해 발화 방식을 제어할 수 있습니다(Qwen3-TTS-Flash에는 없는 기능).
강점
- 녹음된 샘플에서 복제한 음성이나 텍스트 설명으로 설계한 음성을 사용할 수 있습니다.
- 톤과 말하기 스타일을 제어하는 지시 사항을 입력받습니다.
- 만다린어, 광둥어, 다양한 중국 방언뿐만 아니라 영어, 프랑스어, 독일어, 일본어, 한국어, 러시아어, 포르투갈어, 태국어, 인도네시아어, 베트남어를 구사합니다.
- WebSocket을 통해 오디오를 스트리밍하므로 합성이 완료되기 전에 재생을 시작할 수 있습니다.
다른 모델이 필요한 경우
- 내장된 시스템 음성이 없으므로, 먼저 음성을 복제하거나 설계해야 합니다.
- 단순 HTTP 요청이 아닌 WebSocket 클라이언트가 필요합니다.
- 음성 복제를 위해서는 깨끗한 참조 샘플과 해당 음성 사용에 대한 동의가 필요합니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
텍스트 음성 변환TokenLab 엔드포인트POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
Cosy Tts Number
100만 문자당- Official 가격
- 입력 $22.06 / 출력 $0.00
- Official
- 입력 $22.06 / 출력 $0.00
- 할인
- —
| Official 가격100만 문자당 | Official100만 문자당 | 할인 | |
|---|---|---|---|
| Cosy Tts Number | 입력 $22.06 / 출력 $0.00 | 입력 $22.06 / 출력 $0.00 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 CosyVoice v3.5 Plus을 열고 프롬프트를 수정하거나 전송하세요.
/v1/audio/speech에서 cosyvoice-v3.5-plus로 짧은 오디오 요청을 테스트합니다. 결과와 비용을 확인하세요.
사용 사례
브랜드 음성
승인된 화자의 음성을 한 번 복제하여 제품 소개, IVR 안내, 공지 사항 등에 사용합니다.
캐릭터 음성
오디오북이나 게임을 위해 '따뜻한 노년의 이야기꾼'과 같이 설명에 기반한 음성을 설계합니다.
지역 방언 내레이션
쓰촨어, 상하이어, 광둥어 등으로 현지 청중을 위한 음성 콘텐츠를 제작합니다.
프롬프트 예제
이 공지 사항을 활기차고 밝은 톤으로 읽어주고, 날짜 뒤에는 짧게 멈춰주세요.
다음 단락을 마치 잠자리 동화를 읽어주듯이 느리고 따뜻하게 말해주세요.
이 내용을 광둥어로 편안하고 대화하듯 말해주세요.
FAQ
CosyVoice v3.5 Plus에 사전 설정된 음성이 있나요?
아니요. Alibaba는 이 모델에 대해 시스템 음성을 제공하지 않습니다. 샘플에서 복제하거나 텍스트 설명으로 설계한 음성이 필요하며, 합성 시 해당 음성을 전달해야 합니다.
어떤 언어와 방언을 지원하나요?
만다린어, 광둥어, 다양한 중국 방언과 영어, 프랑스어, 독일어, 일본어, 한국어, 러시아어, 포르투갈어, 태국어, 인도네시아어, 베트남어를 지원합니다. 방언 지원 여부는 Qwen3-TTS-Flash 모델과의 주요 차이점입니다.
음성을 제어할 수 있나요?
네. 이 모델은 지시 제어를 지원하므로 자연어로 톤, 감정, 속도를 설명할 수 있습니다. 음성 선택은 누가 말할지를 결정하고, 지시 사항은 어떻게 말할지를 결정합니다.
어떻게 호출하나요?
생성되는 오디오를 실시간으로 스트리밍하는 WebSocket API를 통해 호출합니다. 긴 스크립트와 실시간 재생에 적합하지만, 연결을 처리할 클라이언트가 필요합니다.
Qwen3-TTS-Flash는 언제 선택해야 하나요?
준비된 음성을 사용하고 싶고, 복제나 지시 사항 없이 간단한 HTTP 호출을 원할 때 선택하세요. 음성 정체성이나 전달 스타일이 제품의 핵심 요소라면 CosyVoice를 선택하세요.
CosyVoice v3.5 Plus 의 가격은 얼마인가요?
TokenLab 에서 CosyVoice v3.5 Plus 은 입력 $22.06 / 출력 $0.00 100만 문자당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
CosyVoice v3.5 Plus 은 어떤 엔드포인트를 써야 하나요?
CosyVoice v3.5 Plus에 대해 https://api.tokenlab.sh/v1/audio/speech를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
CosyVoice v3.5 Plus 은 어떤 오퍼레이션을 지원하나요?
CosyVoice v3.5 Plus은(는) 텍스트 음성 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
CosyVoice v3.5 Plus 비교하기
출처
2026. 10. 2. 검토 완료