Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

xAI: Grok STT

Grok STT là dịch vụ chuyển đổi giọng nói thành văn bản của xAI dành cho các bản ghi âm được tải lên. Tích hợp này cung cấp tính năng phiên âm hàng loạt với thời lượng âm thanh được báo cáo; dịch vụ phát trực tuyến thời gian thực sử dụng giao diện và hợp đồng giá riêng.
So sánh mô hình
grok-stt
Sẵn sàngxAIChuyển đổi giọng nói thành văn bảnĐồng bộ
Giá
Từ $0.000028
Phương thức
Âm thanh

Về Grok STT

Grok STT là dịch vụ chuyển đổi giọng nói thành văn bản của xAI dùng để chuyển các bản ghi âm thành văn bản. Mô hình này xử lý các bản ghi âm được tải lên theo lô và trả về bản ghi dưới dạng JSON. xAI ghi nhận hỗ trợ 25 ngôn ngữ trong dịch vụ phiên âm của mình. Tính năng phiên âm phát trực tiếp theo thời gian thực là một giao diện xAI riêng biệt, vì vậy mô hình này phù hợp với các tệp tin đã có sẵn như cuộc họp, cuộc gọi và phỏng vấn.

Ưu điểm

  • Phiên âm các tệp âm thanh được tải lên trong một yêu cầu và trả về kết quả JSON.
  • xAI ghi nhận hỗ trợ 25 ngôn ngữ, bao phủ nhiều bản ghi âm đa ngôn ngữ.
  • Phù hợp với các công việc theo lô như lưu trữ cuộc họp, bản ghi cuộc gọi và các tệp phỏng vấn tồn đọng.
  • Hoạt động thông qua định dạng yêu cầu phiên âm âm thanh tiêu chuẩn, vì vậy các ứng dụng khách kiểu Whisper hiện có chỉ cần thay đổi rất ít.
  • Các bản ghi âm dài được xử lý dưới dạng một tệp tải lên duy nhất thay vì chia thành các đoạn ngắn.

Khi nào nên chọn model khác

  • Chỉ xử lý theo lô; tính năng phụ đề trực tiếp và phát trực tuyến độ trễ thấp cần một giao diện thời gian thực riêng.
  • Đầu ra là bản ghi dưới dạng JSON, không tích hợp sẵn tính năng tóm tắt hoặc dịch thuật.
  • Độ chính xác phụ thuộc vào chất lượng âm thanh, vì vậy giọng nói ồn ào hoặc chồng chéo có thể cần được làm sạch hoặc xem xét lại.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Giọng nói sang văn bảnĐiểm cuối TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Giọng nói sang văn bản

mỗi giây
Giá niêm yết
$0.00002778
Official
$0.00002778
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Grok STT trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử grok-stt với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Bản ghi cuộc họp

    Tải lên các cuộc gọi hoặc cuộc họp đã ghi âm và lưu trữ văn bản để các nhóm có thể tìm kiếm hoặc đưa vào mô hình tóm tắt.

  • Lưu trữ phỏng vấn và podcast

    Chuyển đổi các bản ghi âm tồn đọng thành văn bản để chỉnh sửa, trích dẫn và ghi chú chương trình.

  • Xem lại cuộc gọi hỗ trợ

    Phiên âm các cuộc gọi của khách hàng theo lô để các nhóm chất lượng có thể quét các vấn đề và chủ đề.

Ví dụ prompt

Phiên âm bản ghi cuộc họp nhóm dài 45 phút này bằng tiếng Anh.

Phiên âm cuộc gọi khách hàng được đính kèm. Người nói sử dụng tiếng Tây Ban Nha.

Chuyển đổi bài giảng đã ghi âm này thành văn bản để tôi có thể tìm kiếm phần nói về quang hợp.

FAQ

Grok STT là gì?

Đây là dịch vụ chuyển đổi giọng nói thành văn bản của xAI. Dịch vụ này chấp nhận bản ghi âm được tải lên và trả về bản ghi dưới dạng JSON, hoạt động ở chế độ theo lô thay vì trực tiếp. Hãy sử dụng nó cho các bản ghi âm bạn đã có sẵn, chẳng hạn như cuộc họp, cuộc gọi và phỏng vấn.

Nó hỗ trợ những ngôn ngữ nào?

xAI ghi nhận hỗ trợ 25 ngôn ngữ cho dịch vụ phiên âm của mình. Hãy thử nghiệm một đoạn mẫu ngắn bằng ngôn ngữ của bạn trước, vì độ chính xác thay đổi tùy theo ngôn ngữ và chất lượng bản ghi. Giọng địa phương cũng ảnh hưởng đến kết quả.

Grok STT có thể phiên âm âm thanh trực tiếp không?

Không. Nó chỉ xử lý các tệp đã tải lên, vì vậy hãy sử dụng nó sau khi cuộc gọi hoặc cuộc họp đã kết thúc. xAI cung cấp tính năng phiên âm phát trực tuyến thông qua một giao diện riêng, và tính năng phụ đề trực tiếp cần giao diện đó thay vì mô hình này.

Tôi nhận lại định dạng nào?

Một phản hồi JSON chứa văn bản phiên âm. Bạn có thể chuyển văn bản đó sang một mô hình ngôn ngữ để tóm tắt, tạo các mục hành động hoặc dịch sang ngôn ngữ khác.

Nó khác với Whisper như thế nào?

Cả hai đều phiên âm âm thanh được tải lên thông qua cùng một kiểu yêu cầu. Chúng khác nhau về phạm vi ngôn ngữ và độ chính xác theo loại âm thanh, vì vậy hãy chạy cả hai trên một mẫu bản ghi của bạn và so sánh các bản phiên âm.

Grok STT có giá bao nhiêu?

Trên TokenLab, Grok STT có giá $0.00002778 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Grok STT nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Grok STT. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Grok STT hỗ trợ những thao tác nào?

Grok STT hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Grok STT

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Grok Voice

Mô hình liên quan