Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice là mô hình chuyển văn bản thành giọng nói từ Alibaba cung cấp chín âm sắc cài sẵn cao cấp qua nhiều kết hợp giới tính, độ tuổi, ngôn ngữ và phương ngữ. Nó cung cấp khả năng kiểm soát phong cách chính xác đối với giọng nói mục tiêu thông qua hướng dẫn của người dùng, hỗ trợ sao chép giọng nói từ mẫu 3 giây và tạo giọng nói bằng hơn 10 ngôn ngữ với độ trễ thấp tới 97ms.
So sánh mô hình
qwen3-tts-1-7b-customvoice
Sẵn sàngAlibabaVăn bản thành giọng nóiĐồng bộ
Giá
Từ $0.000015
Phương thức
Âm thanh

Về Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice là mô hình chuyển văn bản thành giọng nói của Alibaba, được xây dựng dựa trên một tập hợp cố định gồm chín giọng nói cài sẵn. Bạn chọn người nói theo tên và có thể thêm hướng dẫn bằng ngôn ngữ tự nhiên về tông giọng, cảm xúc hoặc phong cách nói. Mô hình này nói được mười ngôn ngữ, bao gồm tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn và một số ngôn ngữ châu Âu, với độ trễ tổng hợp đầu cuối được Alibaba công bố thấp nhất là 97 ms cho mục đích sử dụng tương tác.

Ưu điểm

  • Chín người nói cao cấp có tên riêng bao gồm các giới tính, độ tuổi, ngôn ngữ và phương ngữ khác nhau, giúp giọng nói có thể giữ nguyên nhất quán trong suốt một sản phẩm.
  • Một hướng dẫn bằng văn bản có thể điều chỉnh cảm xúc và cách nói mà không cần thay đổi người nói đã chọn.
  • Mười ngôn ngữ được hỗ trợ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý.
  • Alibaba báo cáo độ trễ đầu cuối thấp nhất là 97 ms, phù hợp cho trợ lý giọng nói và thuyết minh trực tiếp.

Khi nào nên chọn model khác

  • Danh sách giọng nói là cố định; để tạo ra một giọng nói mới từ mô tả, biến thể VoiceDesign sẽ là lựa chọn phù hợp hơn.
  • Kết quả đạt chất lượng tốt nhất khi người nói đọc ngôn ngữ mẹ đẻ của họ, vì vậy một giọng cài sẵn tiếng Anh khi đọc tiếng Nhật có thể nghe thấy giọng địa phương (accent).
  • Văn bản đầu vào ồn ào hoặc bất thường, chẳng hạn như chứa nhiều mã đánh dấu (markup) hoặc các ký hiệu hỗn hợp, có thể làm giảm chất lượng đầu ra.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản thành giọng nóiĐiểm cuối TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Văn bản thành giọng nói

Mỗi 1 triệu ký tự
Giá niêm yết
$0.000015
Official
$0.000015
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Qwen3-TTS 1.7B CustomVoice trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử qwen3-tts-1-7b-customvoice với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Trợ lý giọng nói

    Cung cấp cho trợ lý trong ứng dụng một giọng nói cố định có tên riêng và độ trễ phản hồi thấp để các câu trả lời bắt đầu phát nhanh chóng sau khi văn bản đã sẵn sàng.

  • Thuyết minh sách nói và bài viết

    Đọc văn bản dài với người nói đã chọn và thêm hướng dẫn như bình tĩnh và ấm áp để giữ cho cách truyền đạt nhất quán qua các chương.

  • Video sản phẩm được bản địa hóa

    Sử dụng các cài đặt sẵn tiếng Nhật, tiếng Hàn hoặc tiếng Anh để lồng tiếng cho cùng một kịch bản theo từng thị trường trong khi thương hiệu vẫn giữ được âm thanh dễ nhận biết.

  • Lời thoại nhân vật và trò chơi

    Chọn các cài đặt sẵn riêng biệt cho các nhân vật khác nhau và thêm hướng dẫn cảm xúc cho các câu thoại giận dữ, mệt mỏi hoặc hào hứng.

Ví dụ prompt

Người nói: Ryan. Hướng dẫn: bình tĩnh, thân thiện, hơi chậm. Văn bản: Welcome back. Your order has shipped and should arrive on Thursday.

Người nói: Ono_Anna. Hướng dẫn: phát thanh viên vui vẻ. Văn bản: 本日はご来店いただき、ありがとうございます。

Người nói: Vivian. Hướng dẫn: thì thầm, như đang kể một bí mật. Văn bản: 你听说了吗?明天会有一个大消息。

FAQ

Qwen3-TTS CustomVoice cung cấp những giọng nói nào?

Chín cài đặt sẵn: Vivian, Serena, Uncle_Fu, Dylan và Eric cho các biến thể tiếng Trung; Ryan và Aiden cho tiếng Anh; Ono_Anna cho tiếng Nhật; và Sohee cho tiếng Hàn. Bạn chọn một giọng theo tên cho mỗi yêu cầu.

Tôi có thể kiểm soát cảm xúc và phong cách nói không?

Có. Bạn có thể thêm hướng dẫn bằng ngôn ngữ tự nhiên, ví dụ như giận dữ, nhẹ nhàng, hoặc nhanh và hào hứng, và mô hình sẽ điều chỉnh tông giọng và cách truyền đạt trong khi vẫn giữ nguyên âm sắc của người nói đã chọn.

CustomVoice khác với VoiceDesign như thế nào?

CustomVoice sử dụng chín người nói cố định mà bạn lựa chọn. VoiceDesign không có danh sách cài sẵn; bạn mô tả giọng nói mình muốn bằng từ ngữ, chẳng hạn như độ tuổi, tâm trạng và ngữ điệu, và mô hình sẽ tạo ra giọng nói đó. Hãy chọn CustomVoice để đảm bảo tính nhất quán và VoiceDesign để tạo ra các giọng nói mới.

Nó nói được những ngôn ngữ nào?

Mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý. Thẻ mô hình khuyến nghị sử dụng mỗi người nói bằng ngôn ngữ mẹ đẻ của họ để có chất lượng tốt nhất.

Nó có đủ nhanh cho hội thoại trực tiếp không?

Alibaba tuyên bố độ trễ tổng hợp đầu cuối thấp nhất là 97 ms, nhắm đến mục đích sử dụng thời gian thực. Độ trễ thực tế trong ứng dụng của bạn còn phụ thuộc vào khoảng cách mạng và độ dài văn bản, vì vậy hãy đo lường bằng lưu lượng truy cập của riêng bạn.

Qwen3-TTS 1.7B CustomVoice có giá bao nhiêu?

Trên TokenLab, Qwen3-TTS 1.7B CustomVoice có giá - . Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Qwen3-TTS 1.7B CustomVoice nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Qwen3-TTS 1.7B CustomVoice. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Qwen3-TTS 1.7B CustomVoice hỗ trợ những thao tác nào?

Qwen3-TTS 1.7B CustomVoice hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Qwen3-TTS 1.7B CustomVoice

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Qwen TTS

Mô hình liên quan