Alibaba: Paraformer v2
paraformer-v2- Giá
- Từ $0.000012
- Phương thức
- Âm thanh
Về Paraformer v2
Paraformer v2 là mô hình nhận dạng giọng nói dựa trên tệp của Alibaba dành cho việc chép lời ngoại tuyến các cuộc họp và hội thoại dài. Mô hình này được gọi bất đồng bộ cho các bản ghi có dung lượng lên đến 2 GB và thời lượng 12 giờ. So với Paraformer 8K v2, mô hình này dành cho âm thanh băng thông rộng thông thường, và so với các mô hình thời gian thực, nó đánh đổi tính tức thời để lấy một bản chép lời hoàn chỉnh kèm theo phân đoạn người nói và từ khóa ưu tiên.
Ưu điểm
- Xử lý các bản ghi rất dài, lên đến 12 giờ hoặc 2 GB mỗi tệp theo tài liệu của Alibaba.
- Dấu thời gian luôn được bao gồm, vì vậy không cần tùy chọn bổ sung để lấy chúng.
- Phân đoạn người nói giúp tách biệt những người tham gia trong các cuộc họp và thảo luận nhóm.
- Bộ lọc từ ngữ nhạy cảm có thể che các thuật ngữ được liệt kê trong văn bản chép lời.
Khi nào nên chọn model khác
- Kết quả sẽ có sau khi công việc hoàn tất; phụ đề trực tiếp cần dùng Paraformer Realtime v2.
- Đối với các bản ghi điện thoại 8 kHz, biến thể 8K khớp với âm thanh tốt hơn.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Giọng nói sang văn bảnĐiểm cuối TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Giọng nói sang văn bản
mỗi giây- Giá niêm yết
- $0.00001176
- Official
- $0.00001176
- Giảm giá
- —
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Giọng nói sang văn bản | $0.00001176 | $0.00001176 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Paraformer v2 trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử paraformer-v2 với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Lưu trữ cuộc họp
Chuyển đổi các bản ghi cuộc họp đã lưu thành văn bản có thể tìm kiếm với nhãn người nói và dấu thời gian.
Chép lời bài giảng
Chép lời các bài giảng kéo dài nhiều giờ một lần, sau đó lập chỉ mục hoặc tóm tắt văn bản cho sinh viên.
Chuẩn bị kiểm duyệt nội dung
Che các từ ngữ nhạy cảm đã cấu hình trong bản chép lời trước khi chia sẻ với nhóm rộng hơn.
Ví dụ prompt
Chép lời bản ghi cuộc họp toàn thể kéo dài 3 giờ này với nhãn người nói và dấu thời gian.
Chép lời âm thanh của video bài giảng này và che các từ ngữ nhạy cảm được liệt kê.
Chép lời các bản ghi cuộc họp nhanh hàng tuần này bằng cách sử dụng từ khóa ưu tiên cho tên dự án của chúng tôi.
FAQ
Paraformer v2 phù hợp nhất cho việc gì?
Chép lời ngoại tuyến các cuộc họp, phỏng vấn và hội thoại đã ghi âm. Nó chấp nhận các định dạng âm thanh và video phổ biến ở mọi tốc độ lấy mẫu và trả về văn bản cùng với dấu thời gian.
Dung lượng đầu vào tối đa là bao nhiêu?
Alibaba ghi nhận các tệp lên đến 2 GB và 12 giờ cho các mô hình tệp Paraformer của mình. Hãy chia nhỏ bất kỳ tệp nào dài hơn trước khi gửi để chép lời.
Tôi có thể tắt dấu thời gian không?
Không. Alibaba tuyên bố rằng dấu thời gian được bật vĩnh viễn cho Paraformer, vì vậy mọi bản chép lời đều có chúng và không cần tùy chọn yêu cầu nào để lấy vị trí thời gian.
Paraformer v2 hay Fun-ASR?
Cả hai đều chép lời các tệp với tính năng phân đoạn người nói và từ khóa ưu tiên. Fun-ASR là dòng mới hơn; Paraformer v2 là dòng đã được khẳng định. Hãy chạy thử một mẫu âm thanh của bạn qua từng mô hình và so sánh các lỗi quan trọng đối với bạn.
Paraformer v2 có giá bao nhiêu?
Trên TokenLab, Paraformer v2 có giá $0.00001176 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Paraformer v2 nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Paraformer v2. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Paraformer v2 hỗ trợ những thao tác nào?
Paraformer v2 hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Paraformer v2
Nguồn
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
Đánh giá ngày 2 thg 10, 2026