Mô hình âm thanh

Các mô hình AI cho xử lý giọng nói, âm nhạc và âm thanh

Âm thanh · Alibaba Cloud

cosyvoice-v3.5-plus
Sẵn sàng
Văn bản thành giọng nói
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$22.06Đầu ra$0.00/1 triệu ký tự
qwen3.5-omni-flash-realtime
Sẵn sàng
Sử dụng công cụThị giácTìm kiếm web
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$3.97Đầu ra$15.74/1M
qwen3.5-omni-plus-realtime
Sẵn sàng
Sử dụng công cụThị giácTìm kiếm web
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$11.76Đầu ra$44.12/1M
qwen3-livetranslate-flash
Sẵn sàng
Thị giác
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$1.47Đầu ra$1.47/1M
qwen3.5-livetranslate-flash-realtime
Sẵn sàng
Thị giác
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$5.88Đầu ra$14.71/1M
fun-asr
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00003235/giây
fun-asr-flash-2026-06-15
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00003235/giây
fun-asr-realtime
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00004853/giây
paraformer-8k-v2
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00001177/giây
paraformer-realtime-8k-v2
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.0000353/giây
paraformer-realtime-v2
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.0000353/giây
paraformer-v2
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00001177/giây
qwen3-asr-flash
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00003235/giây
qwen3-asr-flash-filetrans
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00003235/giây
qwen3-asr-flash-realtime
Sẵn sàng
Chuyển giọng nói thành văn bản
Giá TokenLab— Giảm giá
—
Giá niêm yết
$0.00004853/giây
qwen3-tts-flash
Sẵn sàng
Văn bản thành giọng nói
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$11.76Đầu ra$0.00/1 triệu ký tự
qwen3-tts-flash-realtime
Sẵn sàng
Văn bản thành giọng nói
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$14.71Đầu ra$0.00/1 triệu ký tự
sambert-zhiyuan-v1
Sẵn sàng
Văn bản thành giọng nói
Giá TokenLab— Giảm giá
—
Giá niêm yết
Đầu vào$14.71Đầu ra$0.00/1 triệu ký tự

Tất cả dòng mô hình

3 dòng

Chọn mô hình âm thanh phù hợp

Mô hình phù hợp nhất là sự cân bằng giữa yêu cầu công việc, chất lượng đầu ra, độ trễ và chi phí.

Tín hiệu lựa chọn

  • Chọn mô hình phù hợp với nhu cầu đầu vào và đầu ra thực tế.
  • So sánh các mô hình sử dụng cùng đơn vị tính giá.
  • Thử nghiệm thực tế giúp thấy rõ sự khác biệt về chất lượng và độ trễ mà danh mục không thể hiện hết.

FAQ

Thế nào là một mô hình âm thanh tốt?

Một lựa chọn tốt cần đáp ứng đúng yêu cầu, tiêu chuẩn chất lượng, tốc độ phản hồi và ngân sách. Bạn nên dùng tập dữ liệu đánh giá nhỏ để thấy rõ sự khác biệt về chất lượng và độ ổn định.

Tôi có thể đổi mô hình sau không?

Có. Hãy giữ ID mô hình công khai và định dạng yêu cầu nhất quán để so sánh các lựa chọn thay thế trên cùng một tác vụ.