xAI: Grok Voice Latest
grok-voice-latest- 価格
- 価格 $0.001333
- リリース日
- 2026年4月23日
- モダリティ
- オーディオ
Grok Voice Latest について
Grok Voice Latestは、WebSocketセッションを通じて音声会話を行うための、xAIのリアルタイム音声対音声モデルを指すフローティングエイリアスです。レビュー時点ではgrok-voice-think-fast-2.0を指しています。コードを変更せずにxAIの改善を反映させたい場合はこれを選択し、動作を固定する必要がある場合はバージョン指定されたモデルを固定してください。
得意なこと
- これは、セッション設定を変更することなく、モデルのアップグレードを自動的に受け取るべき音声エージェントに対してxAIが推奨するエイリアスです。
- セッションでは、組み込みまたはカスタムの音声、ターン交代のためのサーバーサイド音声アクティビティ検出、および文字起こしのための言語ヒントを利用できます。
- エージェントは、WebおよびX検索、ドキュメントコレクションに対するファイル検索、リモートMCPサーバー、およびカスタム関数ツールを呼び出すことができます。
- セッションは会話IDを再利用することで接続切断後も再開できるため、電話やモバイルクライアントに適しています。
他のモデルを検討すべきケース
- エイリアスは更新されるため、アップグレード後に音声、ペース、または言い回しが変わる可能性があります。回帰テスト済みの製品には、バージョン指定されたモデルを固定してください。
- これはライブ音声セッションのみを処理します。保存された録音の文字起こしや、準備されたテキストの読み上げには、音声認識(speech-to-text)または音声合成(text-to-speech)モデルが必要です。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
リアルタイムWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
Audio Duration
1秒あたり- 公式価格
- $0.001333
- Official
- $0.001333
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでGrok Voice Latestを開き、プロンプトを編集・送信できます。
grok-voice-latestと/v1/realtimeで音声をテスト。結果とコストを表示します。
ユースケース
電話およびコールセンターエージェント
テレフォニーコーデックを介して着信に応答し、関数ツールでアカウントを検索し、リクエストがポリシー外の場合は担当者に転送します。
アプリ内音声アシスタント
ユーザーが製品に話しかけられるようにします。エフェメラルトークンを使用することでAPIキーをクライアント側に保持せず、ツールを通じてアプリの背後にあるデータにアクセスできます。
ライブ通話中のスクリプトによる開示
モデルが会話の残りの部分を処理する間、コンプライアンス通知のために強制的な固定フレーズを挿入します。
プロンプト例
あなたは歯科医院の予約アシスタントです。発信者に挨拶し、用件を尋ね、カレンダーツールを使用して次の2つの空き枠を提示してください。
発信者がスペイン語に切り替えたらスペイン語で対応し、回答を2文以内に収め、通話を終了する前に注文合計を確認してください。
返品ポリシーのコレクションを検索し、顧客の質問に声で回答し、使用したドキュメントを伝えてください。
FAQ
grok-voice-latestはどのモデルで動作しますか?
これは現在、xAIのGrok Voiceスイートのリアルタイム音声対音声モデルであるgrok-voice-think-fast-2.0を指すエイリアスです。xAIは、基盤となるバージョンが時間の経過とともに変更される可能性があるため、改善を自動的に受け取るためにこのエイリアスの使用を推奨しています。
エイリアスではなくバージョンを固定すべきなのはいつですか?
プロンプト、音声の選択、およびツールの動作をテスト済みで、それらを安定させる必要がある場合は、バージョン指定されたモデルを固定してください。正確な再現性よりも、再デプロイなしでアップグレードを適用することが重要なプロトタイプや製品では、エイリアスを使用してください。
セッションではどのような音声フォーマットが使用されますか?
セッションでは、8 kHzから48 kHzのサンプルレートのPCM、テレフォニー用のG.711 mu-lawおよびA-law、そしてOpusをサポートしています。音声はbase64 JSONメッセージまたはバイナリWebSocketフレームとして送信されます。
音声エージェントはツールを呼び出せますか?
はい。xAIの音声ドキュメントによると、WebおよびX検索、ファイル検索、リモートMCPサーバー、およびJSONスキーマで定義された独自の関数ツールを呼び出せます。セッション設定でツール定義が正しく渡されていることを確認してください。
切断後に会話を維持できますか?
はい。セッション再開機能は以前のターンを会話IDの下でキャッシュするため、ネットワーク切断後に再接続したクライアントは、最初からやり直すことなく同じ対話を継続できます。
Grok Voice Latest の料金はいくらですか?
TokenLab では Grok Voice Latest は $0.001333 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Grok Voice Latest はどのエンドポイントを使うべきですか?
Grok Voice Latest のデフォルトは https://api.tokenlab.sh/v1/realtime です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok Voice Latest はどの操作に対応していますか?
Grok Voice Latest は リアルタイム に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Grok Voice Latest を比較する
Grok Voice Latest を活用するガイド
ソース
2026/10/02 時点での評価