Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Paraformer v2

Paraformer v2 phiên âm âm thanh đã ghi để xử lý ngoại tuyến. Nó hữu ích cho các kho lưu trữ cuộc họp và các bản ghi hội thoại dài hơn cần một bản phiên âm bằng văn bản có thể tái sử dụng sau khi phiên họp kết thúc.
So sánh mô hình
paraformer-v2
Sẵn sàngAlibabaChuyển đổi giọng nói thành văn bảnĐồng bộ / Bất đồng bộ
Giá
Từ $0.000012
Phương thức
Âm thanh

Về Paraformer v2

Paraformer v2 là mô hình nhận dạng giọng nói dựa trên tệp của Alibaba dành cho việc chép lời ngoại tuyến các cuộc họp và hội thoại dài. Mô hình này được gọi bất đồng bộ cho các bản ghi có dung lượng lên đến 2 GB và thời lượng 12 giờ. So với Paraformer 8K v2, mô hình này dành cho âm thanh băng thông rộng thông thường, và so với các mô hình thời gian thực, nó đánh đổi tính tức thời để lấy một bản chép lời hoàn chỉnh kèm theo phân đoạn người nói và từ khóa ưu tiên.

Ưu điểm

  • Xử lý các bản ghi rất dài, lên đến 12 giờ hoặc 2 GB mỗi tệp theo tài liệu của Alibaba.
  • Dấu thời gian luôn được bao gồm, vì vậy không cần tùy chọn bổ sung để lấy chúng.
  • Phân đoạn người nói giúp tách biệt những người tham gia trong các cuộc họp và thảo luận nhóm.
  • Bộ lọc từ ngữ nhạy cảm có thể che các thuật ngữ được liệt kê trong văn bản chép lời.

Khi nào nên chọn model khác

  • Kết quả sẽ có sau khi công việc hoàn tất; phụ đề trực tiếp cần dùng Paraformer Realtime v2.
  • Đối với các bản ghi điện thoại 8 kHz, biến thể 8K khớp với âm thanh tốt hơn.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Giọng nói sang văn bảnĐiểm cuối TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Giọng nói sang văn bản

mỗi giây
Giá niêm yết
$0.00001176
Official
$0.00001176
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Paraformer v2 trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử paraformer-v2 với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Lưu trữ cuộc họp

    Chuyển đổi các bản ghi cuộc họp đã lưu thành văn bản có thể tìm kiếm với nhãn người nói và dấu thời gian.

  • Chép lời bài giảng

    Chép lời các bài giảng kéo dài nhiều giờ một lần, sau đó lập chỉ mục hoặc tóm tắt văn bản cho sinh viên.

  • Chuẩn bị kiểm duyệt nội dung

    Che các từ ngữ nhạy cảm đã cấu hình trong bản chép lời trước khi chia sẻ với nhóm rộng hơn.

Ví dụ prompt

Chép lời bản ghi cuộc họp toàn thể kéo dài 3 giờ này với nhãn người nói và dấu thời gian.

Chép lời âm thanh của video bài giảng này và che các từ ngữ nhạy cảm được liệt kê.

Chép lời các bản ghi cuộc họp nhanh hàng tuần này bằng cách sử dụng từ khóa ưu tiên cho tên dự án của chúng tôi.

FAQ

Paraformer v2 phù hợp nhất cho việc gì?

Chép lời ngoại tuyến các cuộc họp, phỏng vấn và hội thoại đã ghi âm. Nó chấp nhận các định dạng âm thanh và video phổ biến ở mọi tốc độ lấy mẫu và trả về văn bản cùng với dấu thời gian.

Dung lượng đầu vào tối đa là bao nhiêu?

Alibaba ghi nhận các tệp lên đến 2 GB và 12 giờ cho các mô hình tệp Paraformer của mình. Hãy chia nhỏ bất kỳ tệp nào dài hơn trước khi gửi để chép lời.

Tôi có thể tắt dấu thời gian không?

Không. Alibaba tuyên bố rằng dấu thời gian được bật vĩnh viễn cho Paraformer, vì vậy mọi bản chép lời đều có chúng và không cần tùy chọn yêu cầu nào để lấy vị trí thời gian.

Paraformer v2 hay Fun-ASR?

Cả hai đều chép lời các tệp với tính năng phân đoạn người nói và từ khóa ưu tiên. Fun-ASR là dòng mới hơn; Paraformer v2 là dòng đã được khẳng định. Hãy chạy thử một mẫu âm thanh của bạn qua từng mô hình và so sánh các lỗi quan trọng đối với bạn.

Paraformer v2 có giá bao nhiêu?

Trên TokenLab, Paraformer v2 có giá $0.00001176 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Paraformer v2 nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Paraformer v2. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Paraformer v2 hỗ trợ những thao tác nào?

Paraformer v2 hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Paraformer v2

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Paraformer

Mô hình liên quan