Alibaba: Qwen3-TTS 1.7B CustomVoice
qwen3-tts-1-7b-customvoice- Giá
- Từ $0.000015
- Phương thức
- Âm thanh
Về Qwen3-TTS 1.7B CustomVoice
Qwen3-TTS 1.7B CustomVoice là mô hình chuyển văn bản thành giọng nói của Alibaba, được xây dựng dựa trên một tập hợp cố định gồm chín giọng nói cài sẵn. Bạn chọn người nói theo tên và có thể thêm hướng dẫn bằng ngôn ngữ tự nhiên về tông giọng, cảm xúc hoặc phong cách nói. Mô hình này nói được mười ngôn ngữ, bao gồm tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn và một số ngôn ngữ châu Âu, với độ trễ tổng hợp đầu cuối được Alibaba công bố thấp nhất là 97 ms cho mục đích sử dụng tương tác.
Ưu điểm
- Chín người nói cao cấp có tên riêng bao gồm các giới tính, độ tuổi, ngôn ngữ và phương ngữ khác nhau, giúp giọng nói có thể giữ nguyên nhất quán trong suốt một sản phẩm.
- Một hướng dẫn bằng văn bản có thể điều chỉnh cảm xúc và cách nói mà không cần thay đổi người nói đã chọn.
- Mười ngôn ngữ được hỗ trợ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý.
- Alibaba báo cáo độ trễ đầu cuối thấp nhất là 97 ms, phù hợp cho trợ lý giọng nói và thuyết minh trực tiếp.
Khi nào nên chọn model khác
- Danh sách giọng nói là cố định; để tạo ra một giọng nói mới từ mô tả, biến thể VoiceDesign sẽ là lựa chọn phù hợp hơn.
- Kết quả đạt chất lượng tốt nhất khi người nói đọc ngôn ngữ mẹ đẻ của họ, vì vậy một giọng cài sẵn tiếng Anh khi đọc tiếng Nhật có thể nghe thấy giọng địa phương (accent).
- Văn bản đầu vào ồn ào hoặc bất thường, chẳng hạn như chứa nhiều mã đánh dấu (markup) hoặc các ký hiệu hỗn hợp, có thể làm giảm chất lượng đầu ra.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản thành giọng nóiĐiểm cuối TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-customvoice", "input": "Hello from TokenLab.", "voice": "alloy" }'
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Văn bản thành giọng nói
Mỗi 1 triệu ký tự- Giá niêm yết
- $0.000015
- Official
- $0.000015
- Giảm giá
- —
| Giá niêm yếtMỗi 1 triệu ký tự | OfficialMỗi 1 triệu ký tự | Giảm giá | |
|---|---|---|---|
| Văn bản thành giọng nói | $0.000015 | $0.000015 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Qwen3-TTS 1.7B CustomVoice trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử qwen3-tts-1-7b-customvoice với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Trợ lý giọng nói
Cung cấp cho trợ lý trong ứng dụng một giọng nói cố định có tên riêng và độ trễ phản hồi thấp để các câu trả lời bắt đầu phát nhanh chóng sau khi văn bản đã sẵn sàng.
Thuyết minh sách nói và bài viết
Đọc văn bản dài với người nói đã chọn và thêm hướng dẫn như bình tĩnh và ấm áp để giữ cho cách truyền đạt nhất quán qua các chương.
Video sản phẩm được bản địa hóa
Sử dụng các cài đặt sẵn tiếng Nhật, tiếng Hàn hoặc tiếng Anh để lồng tiếng cho cùng một kịch bản theo từng thị trường trong khi thương hiệu vẫn giữ được âm thanh dễ nhận biết.
Lời thoại nhân vật và trò chơi
Chọn các cài đặt sẵn riêng biệt cho các nhân vật khác nhau và thêm hướng dẫn cảm xúc cho các câu thoại giận dữ, mệt mỏi hoặc hào hứng.
Ví dụ prompt
Người nói: Ryan. Hướng dẫn: bình tĩnh, thân thiện, hơi chậm. Văn bản: Welcome back. Your order has shipped and should arrive on Thursday.
Người nói: Ono_Anna. Hướng dẫn: phát thanh viên vui vẻ. Văn bản: 本日はご来店いただき、ありがとうございます。
Người nói: Vivian. Hướng dẫn: thì thầm, như đang kể một bí mật. Văn bản: 你听说了吗?明天会有一个大消息。
FAQ
Qwen3-TTS CustomVoice cung cấp những giọng nói nào?
Chín cài đặt sẵn: Vivian, Serena, Uncle_Fu, Dylan và Eric cho các biến thể tiếng Trung; Ryan và Aiden cho tiếng Anh; Ono_Anna cho tiếng Nhật; và Sohee cho tiếng Hàn. Bạn chọn một giọng theo tên cho mỗi yêu cầu.
Tôi có thể kiểm soát cảm xúc và phong cách nói không?
Có. Bạn có thể thêm hướng dẫn bằng ngôn ngữ tự nhiên, ví dụ như giận dữ, nhẹ nhàng, hoặc nhanh và hào hứng, và mô hình sẽ điều chỉnh tông giọng và cách truyền đạt trong khi vẫn giữ nguyên âm sắc của người nói đã chọn.
CustomVoice khác với VoiceDesign như thế nào?
CustomVoice sử dụng chín người nói cố định mà bạn lựa chọn. VoiceDesign không có danh sách cài sẵn; bạn mô tả giọng nói mình muốn bằng từ ngữ, chẳng hạn như độ tuổi, tâm trạng và ngữ điệu, và mô hình sẽ tạo ra giọng nói đó. Hãy chọn CustomVoice để đảm bảo tính nhất quán và VoiceDesign để tạo ra các giọng nói mới.
Nó nói được những ngôn ngữ nào?
Mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý. Thẻ mô hình khuyến nghị sử dụng mỗi người nói bằng ngôn ngữ mẹ đẻ của họ để có chất lượng tốt nhất.
Nó có đủ nhanh cho hội thoại trực tiếp không?
Alibaba tuyên bố độ trễ tổng hợp đầu cuối thấp nhất là 97 ms, nhắm đến mục đích sử dụng thời gian thực. Độ trễ thực tế trong ứng dụng của bạn còn phụ thuộc vào khoảng cách mạng và độ dài văn bản, vì vậy hãy đo lường bằng lưu lượng truy cập của riêng bạn.
Qwen3-TTS 1.7B CustomVoice có giá bao nhiêu?
Trên TokenLab, Qwen3-TTS 1.7B CustomVoice có giá - . Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Qwen3-TTS 1.7B CustomVoice nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Qwen3-TTS 1.7B CustomVoice. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Qwen3-TTS 1.7B CustomVoice hỗ trợ những thao tác nào?
Qwen3-TTS 1.7B CustomVoice hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Qwen3-TTS 1.7B CustomVoice
Nguồn
Đánh giá ngày 2 thg 10, 2026