Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- Giá
- Từ $0.000015
- Phương thức
- Âm thanh
Về Qwen3-TTS 1.7B VoiceDesign
Qwen3-TTS 1.7B VoiceDesign là biến thể chuyển văn bản thành giọng nói của Alibaba, tạo ra giọng nói từ mô tả bằng văn bản thay vì danh sách cài sẵn. Bạn mô tả cảm xúc, tông giọng và ngữ điệu bằng ngôn ngữ tự nhiên, và mô hình sẽ đọc văn bản bằng giọng nói đó. Nó bao gồm mười ngôn ngữ và dành cho các trường hợp không có người nói hiện có nào phù hợp với nhân vật hoặc thương hiệu mà bạn đang hướng tới.
Ưu điểm
- Giọng nói được xác định bởi một mô tả, chẳng hạn như một người dẫn chuyện lớn tuổi với cách truyền đạt chậm rãi, ấm áp, thay vì được chọn từ một danh sách cố định.
- Âm sắc, cảm xúc và ngữ điệu đều có thể được điều khiển bằng hướng dẫn, bao gồm cả các trạng thái cảm xúc mạnh như giận dữ.
- Mười ngôn ngữ được bao gồm: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý, cùng với các biến thể phương ngữ.
- Alibaba liệt kê độ trễ tổng hợp thấp khoảng 97 ms cho dòng Qwen3-TTS, vì vậy nó phù hợp cho mục đích sử dụng tương tác.
Khi nào nên chọn model khác
- Cùng một mô tả có thể tạo ra các giọng nói hơi khác nhau trong các lần gọi khác nhau, vì vậy đây là lựa chọn kém tối ưu hơn khi cần một giọng nói chính xác lặp lại trong nhiều tháng.
- Nếu bạn muốn một người nói cố định có tên, biến thể CustomVoice với chín cài đặt sẵn sẽ dễ dự đoán hơn.
- Chất lượng phụ thuộc vào việc bạn mô tả giọng nói rõ ràng như thế nào; các mô tả mơ hồ sẽ cho kết quả chung chung.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản thành giọng nóiĐiểm cuối TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Văn bản thành giọng nói
Mỗi 1 triệu ký tự- Giá niêm yết
- $0.000015
- Official
- $0.000015
- Giảm giá
- —
| Giá niêm yếtMỗi 1 triệu ký tự | OfficialMỗi 1 triệu ký tự | Giảm giá | |
|---|---|---|---|
| Văn bản thành giọng nói | $0.000015 | $0.000015 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Qwen3-TTS 1.7B VoiceDesign trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử qwen3-tts-1-7b-voicedesign với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Giọng nhân vật cho trò chơi
Mô tả từng nhân vật, ví dụ như một thợ rèn người lùn cộc cằn hoặc một người đưa tin trẻ tuổi lo lắng, và tạo lời thoại mà không cần thuê diễn viên lồng tiếng trước.
Khám phá giọng nói thương hiệu
Thử nghiệm một vài mô tả về giọng nói của công ty, chẳng hạn như tự tin và trầm so với tươi sáng và nhanh nhẹn, và so sánh chúng trên cùng một kịch bản.
Thuyết minh biểu cảm
Truyền đạt trực tiếp cho các phần kể chuyện với các hướng dẫn như trầm lắng và căng thẳng, sau đó nhẹ nhõm và ấm áp, trong cùng một dự án.
Giọng nói mẫu cho video
Tạo một người dẫn chuyện tạm thời cho bảng phân cảnh hoặc video giải thích trước khi chọn giọng nói cuối cùng.
Ví dụ prompt
Giọng nói: một phụ nữ trung niên, bình tĩnh và trầm, nói chậm rãi như người dẫn chuyện phim tài liệu. Văn bản: The river has changed course three times in the last century.
Giọng nói: một thanh niên, hào hứng và hơi hụt hơi, tốc độ nhanh. Văn bản: You will not believe what just came through the door.
Giọng nói: nói bằng tông giọng đặc biệt giận dữ, nhanh và dứt khoát (用特别愤怒的语气说). Văn bản: 这已经是第三次了,你们到底有没有在听?
FAQ
Qwen3-TTS VoiceDesign dùng để làm gì?
Nó tạo ra giọng nói theo mô tả bằng từ ngữ của bạn. Thay vì chọn một người nói có tên, bạn viết một mô tả bao gồm cảm xúc, tông giọng và cách truyền đạt, và mô hình sẽ tạo ra âm thanh tuân theo mô tả đó. Nó phù hợp cho các nhân vật và giọng nói thương hiệu không khớp với các cài đặt sẵn có sẵn.
Nó khác với CustomVoice như thế nào?
CustomVoice cung cấp chín người nói cố định có tên với các hướng dẫn phong cách tùy chọn. VoiceDesign không có danh sách cố định và xây dựng giọng nói từ mô tả của bạn. Hãy chọn VoiceDesign để tạo ra thứ gì đó mới mẻ và CustomVoice cho một người nói ổn định, có thể lặp lại.
Những ngôn ngữ nào được hỗ trợ?
Mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý, cùng với một số biến thể phương ngữ. Hãy viết mô tả giọng nói bằng ngôn ngữ mà mô hình hiểu được; ví dụ trên thẻ mô hình sử dụng tiếng Trung.
Tôi có thể sao chép giọng nói của một người thật bằng nó không?
Dòng Qwen3-TTS có mô tả về việc sao chép giọng nói từ một mẫu ngắn, nhưng trọng tâm của biến thể này là thiết kế dựa trên hướng dẫn. Chỉ sao chép hoặc bắt chước giọng nói mà bạn có quyền sử dụng, và kiểm tra kết quả đầu ra dựa trên các quy tắc đồng ý của riêng bạn.
Giọng nói có giống hệt nhau trong mọi lần gọi không?
Không được đảm bảo. Một mô tả sẽ điều hướng giọng nói nhưng không cố định chính xác một âm sắc, vì vậy các lần gọi lặp lại có thể nghe hơi khác nhau. Nếu bạn cần sự lặp lại chính xác trong một dự án dài, hãy sử dụng người nói cài sẵn cố định thay thế.
Qwen3-TTS 1.7B VoiceDesign có giá bao nhiêu?
Trên TokenLab, Qwen3-TTS 1.7B VoiceDesign có giá - . Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Qwen3-TTS 1.7B VoiceDesign nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Qwen3-TTS 1.7B VoiceDesign. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Qwen3-TTS 1.7B VoiceDesign hỗ trợ những thao tác nào?
Qwen3-TTS 1.7B VoiceDesign hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Qwen3-TTS 1.7B VoiceDesign
Nguồn
Đánh giá ngày 2 thg 10, 2026