Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign là mô hình chuyển văn bản thành giọng nói từ Alibaba tạo ra giọng nói tùy chỉnh từ các mô tả ngôn ngữ tự nhiên chỉ định cảm xúc, tông giọng và nhịp điệu. Nó hỗ trợ sao chép giọng nói từ mẫu âm thanh 3 giây, tạo giọng nói bằng hơn 10 ngôn ngữ bao gồm tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn và các ngôn ngữ châu Âu, và đạt độ trễ thấp tới 97ms.
So sánh mô hình
qwen3-tts-1-7b-voicedesign
Sẵn sàngAlibabaVăn bản thành giọng nóiĐồng bộ
Giá
Từ $0.000015
Phương thức
Âm thanh

Về Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign là biến thể chuyển văn bản thành giọng nói của Alibaba, tạo ra giọng nói từ mô tả bằng văn bản thay vì danh sách cài sẵn. Bạn mô tả cảm xúc, tông giọng và ngữ điệu bằng ngôn ngữ tự nhiên, và mô hình sẽ đọc văn bản bằng giọng nói đó. Nó bao gồm mười ngôn ngữ và dành cho các trường hợp không có người nói hiện có nào phù hợp với nhân vật hoặc thương hiệu mà bạn đang hướng tới.

Ưu điểm

  • Giọng nói được xác định bởi một mô tả, chẳng hạn như một người dẫn chuyện lớn tuổi với cách truyền đạt chậm rãi, ấm áp, thay vì được chọn từ một danh sách cố định.
  • Âm sắc, cảm xúc và ngữ điệu đều có thể được điều khiển bằng hướng dẫn, bao gồm cả các trạng thái cảm xúc mạnh như giận dữ.
  • Mười ngôn ngữ được bao gồm: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý, cùng với các biến thể phương ngữ.
  • Alibaba liệt kê độ trễ tổng hợp thấp khoảng 97 ms cho dòng Qwen3-TTS, vì vậy nó phù hợp cho mục đích sử dụng tương tác.

Khi nào nên chọn model khác

  • Cùng một mô tả có thể tạo ra các giọng nói hơi khác nhau trong các lần gọi khác nhau, vì vậy đây là lựa chọn kém tối ưu hơn khi cần một giọng nói chính xác lặp lại trong nhiều tháng.
  • Nếu bạn muốn một người nói cố định có tên, biến thể CustomVoice với chín cài đặt sẵn sẽ dễ dự đoán hơn.
  • Chất lượng phụ thuộc vào việc bạn mô tả giọng nói rõ ràng như thế nào; các mô tả mơ hồ sẽ cho kết quả chung chung.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản thành giọng nóiĐiểm cuối TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Văn bản thành giọng nói

Mỗi 1 triệu ký tự
Giá niêm yết
$0.000015
Official
$0.000015
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Qwen3-TTS 1.7B VoiceDesign trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử qwen3-tts-1-7b-voicedesign với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Giọng nhân vật cho trò chơi

    Mô tả từng nhân vật, ví dụ như một thợ rèn người lùn cộc cằn hoặc một người đưa tin trẻ tuổi lo lắng, và tạo lời thoại mà không cần thuê diễn viên lồng tiếng trước.

  • Khám phá giọng nói thương hiệu

    Thử nghiệm một vài mô tả về giọng nói của công ty, chẳng hạn như tự tin và trầm so với tươi sáng và nhanh nhẹn, và so sánh chúng trên cùng một kịch bản.

  • Thuyết minh biểu cảm

    Truyền đạt trực tiếp cho các phần kể chuyện với các hướng dẫn như trầm lắng và căng thẳng, sau đó nhẹ nhõm và ấm áp, trong cùng một dự án.

  • Giọng nói mẫu cho video

    Tạo một người dẫn chuyện tạm thời cho bảng phân cảnh hoặc video giải thích trước khi chọn giọng nói cuối cùng.

Ví dụ prompt

Giọng nói: một phụ nữ trung niên, bình tĩnh và trầm, nói chậm rãi như người dẫn chuyện phim tài liệu. Văn bản: The river has changed course three times in the last century.

Giọng nói: một thanh niên, hào hứng và hơi hụt hơi, tốc độ nhanh. Văn bản: You will not believe what just came through the door.

Giọng nói: nói bằng tông giọng đặc biệt giận dữ, nhanh và dứt khoát (用特别愤怒的语气说). Văn bản: 这已经是第三次了,你们到底有没有在听?

FAQ

Qwen3-TTS VoiceDesign dùng để làm gì?

Nó tạo ra giọng nói theo mô tả bằng từ ngữ của bạn. Thay vì chọn một người nói có tên, bạn viết một mô tả bao gồm cảm xúc, tông giọng và cách truyền đạt, và mô hình sẽ tạo ra âm thanh tuân theo mô tả đó. Nó phù hợp cho các nhân vật và giọng nói thương hiệu không khớp với các cài đặt sẵn có sẵn.

Nó khác với CustomVoice như thế nào?

CustomVoice cung cấp chín người nói cố định có tên với các hướng dẫn phong cách tùy chọn. VoiceDesign không có danh sách cố định và xây dựng giọng nói từ mô tả của bạn. Hãy chọn VoiceDesign để tạo ra thứ gì đó mới mẻ và CustomVoice cho một người nói ổn định, có thể lặp lại.

Những ngôn ngữ nào được hỗ trợ?

Mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Đức, tiếng Pháp, tiếng Nga, tiếng Bồ Đào Nha, tiếng Tây Ban Nha và tiếng Ý, cùng với một số biến thể phương ngữ. Hãy viết mô tả giọng nói bằng ngôn ngữ mà mô hình hiểu được; ví dụ trên thẻ mô hình sử dụng tiếng Trung.

Tôi có thể sao chép giọng nói của một người thật bằng nó không?

Dòng Qwen3-TTS có mô tả về việc sao chép giọng nói từ một mẫu ngắn, nhưng trọng tâm của biến thể này là thiết kế dựa trên hướng dẫn. Chỉ sao chép hoặc bắt chước giọng nói mà bạn có quyền sử dụng, và kiểm tra kết quả đầu ra dựa trên các quy tắc đồng ý của riêng bạn.

Giọng nói có giống hệt nhau trong mọi lần gọi không?

Không được đảm bảo. Một mô tả sẽ điều hướng giọng nói nhưng không cố định chính xác một âm sắc, vì vậy các lần gọi lặp lại có thể nghe hơi khác nhau. Nếu bạn cần sự lặp lại chính xác trong một dự án dài, hãy sử dụng người nói cài sẵn cố định thay thế.

Qwen3-TTS 1.7B VoiceDesign có giá bao nhiêu?

Trên TokenLab, Qwen3-TTS 1.7B VoiceDesign có giá - . Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Qwen3-TTS 1.7B VoiceDesign nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Qwen3-TTS 1.7B VoiceDesign. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Qwen3-TTS 1.7B VoiceDesign hỗ trợ những thao tác nào?

Qwen3-TTS 1.7B VoiceDesign hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Qwen3-TTS 1.7B VoiceDesign

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Qwen TTS

Mô hình liên quan