xAI: Grok Voice STT
grok-voice-stt- Giá
- Từ $0.000028
- Phương thức
- Âm thanh
Về Grok Voice STT
Grok Voice STT là mô hình chuyển đổi giọng nói thành văn bản của xAI, chuyển đổi âm thanh được ghi lại hoặc phát trực tuyến thành các bản ghi văn bản. Nó chấp nhận các định dạng tệp âm thanh phổ biến, trả về dấu thời gian ở cấp độ từ, có thể phân tách người nói và các kênh, đồng thời định dạng số và tiền tệ theo ngôn ngữ. Hãy sử dụng nó cho phụ đề, bản ghi cuộc họp có thể tìm kiếm, và bản ghi cuộc gọi để phục vụ việc phân tích văn bản sau đó.
Ưu điểm
- Dấu thời gian ở cấp độ từ giúp việc xây dựng phụ đề, tìm kiếm nhảy đến khoảnh khắc, và các tệp phụ đề từ bản ghi trở nên trực tiếp.
- Tính năng phân tách người nói (diarization) và phiên âm đa kênh giúp phân biệt ai đã nói gì trong các cuộc họp và các bản ghi cuộc gọi hai chiều.
- Các gợi ý ngôn ngữ và danh sách các thuật ngữ khóa tùy chỉnh định hướng nhận dạng về phía tên sản phẩm và biệt ngữ.
- Định dạng văn bản hiển thị các số, ngày tháng và tiền tệ theo cách mà ngôn ngữ nói viết chúng.
Khi nào nên chọn model khác
- Nó chỉ tạo ra các bản ghi văn bản; việc tóm tắt, dịch thuật hoặc trả lời dựa trên âm thanh cần một mô hình văn bản xử lý sau đó.
- Các bản ghi âm quá ồn có thể cần được điều chỉnh ngưỡng phát hiện giọng nói hoặc cần đầu vào sạch hơn trước khi độ chính xác đạt mức chấp nhận được.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Giọng nói sang văn bảnĐiểm cuối TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Giá
mỗi giây- Official
- $0.000028mỗi giây
- Giá niêm yết
- $0.000028mỗi giây
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Giá | $0.000028mỗi giây | $0.000028mỗi giây | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Grok Voice STT trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử grok-voice-stt với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Bản ghi cuộc họp
Phiên âm một cuộc gọi được ghi lại với các nhãn người nói rõ ràng, sau đó chuyển văn bản sang một công cụ tóm tắt để lấy các hành động cần thực hiện.
Phụ đề cho video
Tạo phụ đề có tính giờ từ bản âm thanh của video đã tải lên bằng cách sử dụng thời gian của từng từ.
Đánh giá chất lượng tổng đài
Phiên âm các bản ghi âm hai kênh với nhân viên và khách hàng ở các kênh riêng biệt, sau đó quét các cụm từ tuân thủ.
Ví dụ prompt
Phiên âm tập podcast dài 45 phút này bằng tiếng Anh với dấu thời gian theo từ và nhãn người nói.
Phiên âm cuộc gọi của khách hàng được đính kèm, sử dụng các thuật ngữ khóa 'Zyntra', 'OmniPlan' và 'SLA' để định hướng nhận dạng.
Chuyển đổi đoạn ghi âm tiếng Tây Ban Nha này thành văn bản và định dạng các số tiền thành dạng tiền tệ.
FAQ
Grok Voice STT làm những gì?
Nó chuyển đổi âm thanh thành văn bản. Bạn gửi một tệp hoặc truyền trực tuyến âm thanh, và nó trả về một bản ghi có thể bao gồm dấu thời gian ở cấp độ từ, nhãn người nói và văn bản theo từng kênh, tùy thuộc vào các tùy chọn bạn thiết lập.
Nó có thể đọc các định dạng âm thanh nào?
xAI liệt kê mười hai định dạng, bao gồm MP3, WAV, FLAC và Opus, với giới hạn kích thước tệp là 500 MB. Âm thanh PCM thô, mu-law và A-law cần các tham số mã hóa tường minh.
Nó có hỗ trợ phiên âm trực tiếp không?
Có. Điểm cuối WebSocket truyền phát các kết quả tạm thời và sử dụng tính năng phát hiện kết thúc lượt nói Smart Turn để phân biệt khoảng dừng tự nhiên với phần kết thúc của một câu, giúp giảm thiểu việc ngắt quãng quá sớm.
Nó hỗ trợ bao nhiêu ngôn ngữ?
xAI tài liệu hóa hơn 25 ngôn ngữ cho việc phiên âm và định dạng theo ngôn ngữ. Hãy truyền gợi ý ngôn ngữ khi bạn biết ngôn ngữ đó, để quá trình nhận dạng không phải đoán.
Nó có thể phân biệt các người nói với nhau không?
Có, tính năng diarization dán nhãn người nói trong một bản ghi âm, và chế độ đa kênh xử lý tối đa tám kênh riêng biệt, phù hợp với các bản ghi cuộc gọi có mỗi bên ở một kênh.
Grok Voice STT có giá bao nhiêu?
Trên TokenLab, Grok Voice STT có giá $0.000028 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ.
Grok Voice STT nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Grok Voice STT. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Grok Voice STT hỗ trợ những thao tác nào?
Grok Voice STT hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Grok Voice STT
Nguồn
Đánh giá ngày 2 thg 10, 2026