Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

xAI: Grok TTS

Grok TTS tạo ra lời nói từ văn bản bằng cách sử dụng các giọng nói biểu cảm của xAI. Giao diện được công bố trả về âm thanh MP3 và hỗ trợ chọn giọng nói, giúp nó hữu ích cho các phản hồi bằng lời nói, tường thuật và đầu ra giọng nói đa ngôn ngữ.
So sánh mô hình
grok-tts
Sẵn sàngxAIVăn bản thành giọng nóiĐồng bộ
Đầu vào / Đầu ra
$15.00 / $0.00
Phương thức
Âm thanh

Về Grok TTS

Grok TTS là mô hình chuyển đổi văn bản thành giọng nói của xAI, biến văn bản viết thành âm thanh nói với giọng điệu biểu cảm. Giao diện trả về âm thanh MP3 và cho phép bạn chọn giọng nói. xAI ghi nhận các thẻ giọng nói nội dòng cho tiếng cười, tiếng thì thầm và khoảng dừng, vì vậy các kịch bản có thể mang theo các chỉ dẫn truyền đạt. Nó phù hợp cho các phản hồi bằng giọng nói, tường thuật và đầu ra giọng nói đa ngôn ngữ.

Ưu điểm

  • Cung cấp một danh sách lớn các giọng nói biểu cảm, vì vậy bạn có thể chọn một giọng phù hợp với sản phẩm hoặc nhân vật.
  • Trả về âm thanh MP3, có thể phát trên trình duyệt và ứng dụng mà không cần chuyển đổi.
  • xAI ghi nhận các thẻ nội dòng như tiếng cười, tiếng thì thầm và khoảng dừng để định hình cách truyền đạt bên trong văn bản.
  • Tất cả các giọng nói tích hợp đều hoạt động trên các ngôn ngữ được hỗ trợ, vì vậy một giọng nói có thể nói nhiều ngôn ngữ.
  • Văn bản thuần túy được nhập vào và tệp âm thanh hoàn chỉnh được xuất ra, giúp các kịch bản dài dễ dàng tự động hóa.

Khi nào nên chọn model khác

  • Đầu ra chỉ là MP3 thông qua giao diện này, vì vậy các định dạng điện thoại cần phải chuyển đổi.
  • Sao chép giọng nói và phát trực tuyến thời gian thực là các tính năng riêng biệt và không phải là một phần của yêu cầu này.
  • Các kịch bản dài cần được chia thành các đoạn nhỏ, và bạn nên nghe cách phát âm tên riêng và từ viết tắt.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản thành giọng nóiĐiểm cuối TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "model": "grok-tts",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Văn bản thành giọng nói

Mỗi 1 triệu ký tự
Giá niêm yết
Đầu vào $15.00 / Đầu ra $0.00
Official
Đầu vào $15.00 / Đầu ra $0.00
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Grok TTS trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử grok-tts với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Trợ lý giọng nói

    Đọc to các phản hồi từ mô hình trò chuyện, chọn một giọng nói phù hợp với sản phẩm.

  • Tường thuật và sách nói

    Chuyển đổi bài viết, bài học hoặc chương sách thành tệp âm thanh, thêm các thẻ khoảng dừng ở những nơi cần ngắt nhịp.

  • Thông báo đa ngôn ngữ

    Tạo cùng một thông điệp bằng nhiều ngôn ngữ sử dụng một giọng nói để có âm thanh thương hiệu nhất quán.

Ví dụ prompt

Chào mừng bạn quay lại! [khoảng dừng] Đơn hàng của bạn đã được gửi và sẽ đến vào thứ Năm.

Đọc mô tả sản phẩm này bằng giọng điệu bình tĩnh, thân thiện, thì thầm dòng cuối cùng.

Tường thuật đoạn văn sau bằng tiếng Pháp với nhịp độ đều, có khoảng dừng ngắn sau mỗi câu.

FAQ

Grok TTS là gì?

Đây là mô hình chuyển đổi văn bản thành giọng nói của xAI. Bạn gửi văn bản, chọn giọng nói và nhận âm thanh nói dưới dạng tệp MP3. Nó dành cho các phản hồi bằng giọng nói, tường thuật và đầu ra giọng nói đa ngôn ngữ từ văn bản viết.

Tôi có thể chọn giọng nói không?

Có. xAI cung cấp một danh sách các giọng nói biểu cảm, với 'eve' là mặc định. Giọng nói là một tùy chọn yêu cầu, vì vậy bạn có thể thay đổi nó cho mỗi cuộc gọi để phù hợp với kịch bản.

Nó có hỗ trợ giọng nói biểu cảm không?

xAI ghi nhận các thẻ giọng nói nội dòng cho các hiệu ứng như tiếng cười, tiếng thì thầm và khoảng dừng. Hãy đặt chúng vào văn bản tại nơi bạn muốn hiệu ứng và nghe kết quả.

Nó có thể nói những ngôn ngữ nào?

xAI tuyên bố rằng các giọng nói tích hợp của họ hoạt động trên tất cả các ngôn ngữ có sẵn. Hãy thử nghiệm ngôn ngữ của bạn với một đoạn văn ngắn trước, chú ý đến tên riêng và số.

Nó trả về định dạng âm thanh nào?

MP3, có thể phát trực tiếp trên trình duyệt và ứng dụng di động. Nếu nền tảng của bạn cần định dạng khác, chẳng hạn như âm thanh điện thoại, hãy chuyển đổi tệp sau khi tạo. Bất kỳ công cụ âm thanh tiêu chuẩn nào cũng có thể thực hiện việc chuyển đổi này.

Grok TTS có giá bao nhiêu?

Trên TokenLab, Grok TTS có giá Đầu vào $15.00 / Đầu ra $0.00 Mỗi 1 triệu ký tự. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Grok TTS nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Grok TTS. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Grok TTS hỗ trợ những thao tác nào?

Grok TTS hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Grok TTS

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Grok Voice

Mô hình liên quan