Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

xAI: Grok Voice TTS

Grok Voice TTS tạo giọng nói từ văn bản viết với giọng nói và ngôn ngữ đã chọn. Nó phù hợp với tường thuật bản địa hóa, thông báo bằng giọng nói và các ứng dụng cần hiển thị văn bản đã chuẩn bị dưới dạng phản hồi âm thanh.
So sánh mô hình
grok-voice-tts
Sẵn sàngxAIVăn bản thành giọng nóiĐồng bộ
Đầu vào / Đầu ra
$15.00 / $0.00
Phương thức
Âm thanh

Về Grok Voice TTS

Grok Voice TTS là mô hình chuyển văn bản thành giọng nói của xAI, hiển thị văn bản viết dưới dạng âm thanh nói bằng giọng nói và ngôn ngữ đã chọn. Các thẻ nội dòng như tạm dừng, cười và thì thầm giúp định hình cách truyền đạt. Sử dụng nó cho tường thuật, thông báo bằng giọng nói và các câu trả lời âm thanh được bản địa hóa khi văn bản đã được viết sẵn và không cần hội thoại trực tiếp.

Ưu điểm

  • Các thẻ giọng nói nội dòng như [pause] và [laugh], cộng với các thẻ bao quanh như whisper, cung cấp khả năng kiểm soát cách truyền đạt ngay trong chính văn bản.
  • Tất cả các giọng nói tích hợp sẵn đều nói các ngôn ngữ được hỗ trợ, vì vậy một danh tính giọng nói có thể được sử dụng trên các phiên bản bản địa hóa của cùng một nội dung.
  • Các giọng nói tùy chỉnh có thể được sao chép từ một đoạn clip tham chiếu ngắn cho giọng nói thương hiệu hoặc nhân vật.
  • Dấu thời gian ở cấp độ ký tự có thể được trả về để đồng bộ hóa phụ đề hoặc chuyển động môi với âm thanh.

Khi nào nên chọn model khác

  • Nó nói văn bản cố định; một người gọi ngắt lời hoặc trả lời cần một mô hình giọng nói hội thoại thay thế.
  • Chất lượng đầu ra cho các kịch bản dài phụ thuộc vào dấu câu và thẻ trong văn bản nguồn, vì vậy văn bản máy chưa qua chỉnh sửa có thể nghe đơn điệu.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản thành giọng nóiĐiểm cuối TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Giá

Mỗi 1 triệu ký tự
Official
Đầu vào$15.00/1 triệu ký tựĐầu ra$0.00/1 triệu ký tự
Giá niêm yết
Đầu vào$15.00/1 triệu ký tựĐầu ra$0.00/1 triệu ký tự

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Grok Voice TTS trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử grok-voice-tts với yêu cầu âm thanh ngắn tại /v1/audio/speech. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Bài báo và bài học được tường thuật

    Chuyển một bài báo hoặc kịch bản khóa học đã hoàn thành thành một bản âm thanh, sử dụng các khoảng tạm dừng để phân tách các phần.

  • Cảnh báo bằng giọng nói

    Đọc các cập nhật đơn hàng hoặc thông báo an toàn bằng ngôn ngữ của người dùng thông qua codec điện thoại.

  • Video sản phẩm được bản địa hóa

    Lồng tiếng cho cùng một kịch bản bằng nhiều ngôn ngữ với một giọng nói đã chọn, sau đó sử dụng dấu thời gian để căn chỉnh phụ đề.

Ví dụ prompt

Đọc đoạn văn này bằng giọng trầm ấm, ổn định và thêm một khoảng [pause] ngắn sau mỗi câu.

Nói thông báo sau bằng tiếng Pháp, sau đó lặp lại bằng tiếng Đức, sử dụng cùng một giọng nói.

<whisper>Gói hàng của bạn đã được gửi đi.</whisper> [pause] Nó sẽ đến nơi vào thứ Năm.

FAQ

Grok Voice TTS làm gì?

Nó chuyển đổi văn bản thành âm thanh giọng nói. Bạn chọn một giọng nói, tùy chọn mã ngôn ngữ và định dạng đầu ra, và nó trả về âm thanh cho văn bản đó, bao gồm cả các thẻ biểu cảm bạn đã viết nội dòng.

Nó có thể tạo ra những định dạng âm thanh nào?

MP3, WAV và PCM thô, cộng với các codec điện thoại mu-law và A-law, ở tốc độ lấy mẫu từ 8 kHz đến 48 kHz. Các codec điện thoại phù hợp với hệ thống điện thoại; MP3 phù hợp với phát lại trên web và di động.

Nó có thể nói bao nhiêu ngôn ngữ?

xAI hỗ trợ hai mươi ngôn ngữ được chọn theo mã BCP-47, với tính năng tự động phát hiện ngôn ngữ như một giải pháp thay thế. Mỗi giọng nói tích hợp sẵn có thể nói tất cả các ngôn ngữ được hỗ trợ, vì vậy việc chuyển đổi ngôn ngữ không yêu cầu một giọng nói mới.

Tôi có thể truyền phát âm thanh trong khi văn bản vẫn đang được gửi đến không?

Có. Một điểm cuối WebSocket tạo âm thanh trong thời gian thực khi văn bản được gửi, điều này hữu ích khi một mô hình khác vẫn đang viết phản hồi sẽ được đọc lên.

Tôi có thể sửa các từ phát âm sai không?

Có. Các thay thế phát âm cho phép bạn ánh xạ một thuật ngữ viết sang cách nó nên phát âm, để tên thương hiệu và từ viết tắt được đọc đúng mà không cần chỉnh sửa văn bản hiển thị.

Grok Voice TTS có giá bao nhiêu?

Trên TokenLab, Grok Voice TTS có giá Đầu vào $15.00 / Đầu ra $0.00 Mỗi 1 triệu ký tự. Bảng giá phía trên cho thấy chi tiết đầy đủ.

Grok Voice TTS nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/speech làm mặc định cho Grok Voice TTS. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Grok Voice TTS hỗ trợ những thao tác nào?

Grok Voice TTS hỗ trợ Văn bản thành giọng nói. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Grok Voice TTS

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Grok Voice

Mô hình liên quan