xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- Giá
- Từ $0.001333
- Phương thức
- Âm thanh
Về Grok Voice Think Fast 2.0
Grok Voice Think Fast 2.0 là mô hình giọng nói thời gian thực của xAI dành cho các cuộc hội thoại trực tiếp, hai chiều, được xây dựng cho các trợ lý cần theo kịp người nói thay vì đọc một kịch bản soạn sẵn. Đây là mô hình có phiên bản đằng sau bí danh grok-voice-latest. Hãy sử dụng ID chính xác này khi một sản phẩm cần một phiên bản mô hình cố định cho các phản hồi bằng lời nói của nó.
Ưu điểm
- Đây là bản phát hành cố định, có phiên bản đằng sau bí danh tác nhân giọng nói của xAI, vì vậy hành vi vẫn gắn liền với một mô hình cho đến khi bạn chuyển sang mô hình khác.
- Tính năng phát hiện hoạt động giọng nói phía máy chủ quản lý việc luân phiên lượt nói, vì vậy máy khách truyền phát âm thanh từ micrô mà không cần logic tạm dừng riêng.
- Các hướng dẫn cho mỗi phản hồi cho phép một phiên thay đổi lời nhắc hệ thống cho một câu trả lời duy nhất, ví dụ như để thay đổi tông giọng cho phần giải thích về hoàn tiền.
- Các thay thế phát âm giúp sửa cách đọc tên và thuật ngữ sản phẩm mà không làm thay đổi bản ghi.
Khi nào nên chọn model khác
- Đây là mô hình hội thoại chuyển đổi giọng nói thành giọng nói, vì vậy việc phiên âm hàng loạt các tệp và tường thuật các văn bản dài sẽ được xử lý tốt hơn bởi các mô hình giọng nói chuyên dụng.
- Việc duy trì kết nối mở cho âm thanh trực tiếp cần một máy khách WebSocket; một lệnh gọi yêu cầu và phản hồi thông thường sẽ không thể vận hành nó.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Âm thanhChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Audio Duration
mỗi giây- Giá niêm yết
- $0.001333
- Official
- $0.001333
- Giảm giá
- —
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Tình huống sử dụng
Thay thế phản hồi bằng giọng nói tương tác
Thay thế các hệ thống menu điện thoại bằng một người gọi chỉ cần nêu vấn đề, trong khi tác nhân chuyển cuộc gọi hoặc giải quyết vấn đề đó.
Đối tác luyện tập ngôn ngữ
Thực hiện đối thoại bằng lời nói trong một ngôn ngữ mục tiêu, sửa lỗi trực tiếp và điều chỉnh tốc độ khi người học yêu cầu.
Trợ lý thực địa rảnh tay
Cho phép kỹ thuật viên đặt câu hỏi về hướng dẫn sử dụng bằng giọng nói và nghe câu trả lời trong khi cả hai tay vẫn đang làm việc với thiết bị.
Ví dụ prompt
Bạn là một nhân viên hỗ trợ bình tĩnh của một nhà cung cấp internet. Hãy hỏi mã bưu chính của tài khoản, sau đó hướng dẫn người gọi khởi động lại bộ định tuyến.
Phát âm thương hiệu 'Zyntra' của chúng tôi là ZIN-tra, giữ tông giọng thân thiện và không bao giờ ngắt lời người gọi khi họ đang nói.
Đóng vai gia sư tiếng Bồ Đào Nha. Nói chậm, lặp lại câu đã sửa của tôi và đặt một câu hỏi tiếp theo sau mỗi lượt.
FAQ
Sự khác biệt giữa grok-voice-think-fast-2.0 và grok-voice-latest là gì?
grok-voice-think-fast-2.0 là một phiên bản mô hình cụ thể, trong khi grok-voice-latest là một bí danh hiện đang trỏ đến nó. Bí danh sẽ chuyển sang các bản phát hành mới hơn; tên có ngày tháng vẫn giữ nguyên phiên bản bạn đã thử nghiệm.
Grok Voice Think Fast 2.0 có phải là mô hình chuyển văn bản thành giọng nói không?
Không. Nó lắng nghe và trả lời trong một phiên trực tiếp, nhận âm thanh đầu vào và tạo ra các phản hồi bằng lời nói. Để chuyển văn bản soạn sẵn thành âm thanh, hãy sử dụng Grok Voice TTS; để phiên âm các bản ghi âm, hãy sử dụng Grok Voice STT.
Nó quyết định khi nào tôi nói xong như thế nào?
Các phiên có thể kích hoạt tính năng phát hiện hoạt động giọng nói phía máy chủ, giúp phát hiện thời điểm kết thúc lượt nói của người dùng và bắt đầu phản hồi. Bạn cũng có thể tự quản lý lượt nói nếu máy khách của bạn đã có tính năng nhấn để nói (push-to-talk).
Nó có thể sử dụng những giọng nói nào?
Một phiên có thể chọn giữa các giọng nói tích hợp sẵn của xAI, với eve là mặc định, hoặc một giọng nói tùy chỉnh được sao chép từ một bản ghi tham chiếu ngắn. Các giọng nói tích hợp sẵn đều nói được tất cả các ngôn ngữ được hỗ trợ.
Grok Voice Think Fast 2.0 có giá bao nhiêu?
Trên TokenLab, Grok Voice Think Fast 2.0 có giá $0.001333 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Grok Voice Think Fast 2.0 nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/chat/completions làm mặc định cho Grok Voice Think Fast 2.0. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
So sánh Grok Voice Think Fast 2.0
Nguồn
Đánh giá ngày 2 thg 10, 2026