xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- 価格
- 価格 $0.001333
- モダリティ
- オーディオ
Grok Voice Think Fast 2.0 について
Grok Voice Think Fast 2.0は、xAIのリアルタイム音声モデルです。ライブでの双方向会話向けに設計されており、用意されたスクリプトを読み上げるのではなく、話し手のペースに合わせて応答する必要があるアシスタントに適しています。これはgrok-voice-latestエイリアスの背後にあるバージョン指定モデルです。製品で音声応答用に固定のモデルバージョンが必要な場合は、この正確なIDを使用してください。
得意なこと
- これはxAIの音声エージェントエイリアスの背後にある固定されたバージョン指定リリースであるため、別のモデルに切り替えるまで動作は同一のモデルに固定されます。
- サーバーサイドの音声アクティビティ検出(VAD)がターンテーキングを管理するため、クライアント側で一時停止ロジックを実装することなくマイク音声をストリーミングできます。
- 応答ごとの指示(Per-response instructions)により、セッション中に単一の返答に対するシステムプロンプトを変更できます。例えば、返金の説明をする際にトーンを切り替えるといったことが可能です。
- 発音の置き換え機能により、文字起こしを変更することなく、名前や製品用語の読み方を修正できます。
他のモデルを検討すべきケース
- これは会話型の音声対音声(speech-to-speech)モデルです。ファイルのバッチ文字起こしや長いテキストのナレーションには、専用の音声モデルの使用が適しています。
- ライブ音声を維持するにはWebSocketクライアントが必要です。通常の単発のリクエスト・レスポンス呼び出しでは動作しません。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
オーディオChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
Audio Duration
1秒あたり- 公式価格
- $0.001333
- Official
- $0.001333
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
ユースケース
対話型音声応答(IVR)の代替
メニュー形式の電話ツリーを、問題を話すだけでエージェントが転送または解決を行うシステムに置き換えます。
言語練習パートナー
ターゲット言語で会話を行い、間違いを声に出して訂正したり、学習者の要望に応じて話す速度を調整したりします。
ハンズフリーの現場アシスタント
技術者が両手を機器に使ったまま、音声でマニュアルに関する質問を行い、回答を聞くことができます。
プロンプト例
あなたはインターネットプロバイダーの冷静なサポートエージェントです。アカウントの郵便番号を尋ね、その後ルーターの再起動手順を案内してください。
当社のブランド「Zyntra」を「ZIN-tra」と発音し、フレンドリーなトーンを維持し、話し手の言葉を途中で遮らないようにしてください。
ポルトガル語の家庭教師として振る舞ってください。ゆっくり話し、私が言った文章を訂正して繰り返し、各ターンでフォローアップの質問を1つしてください。
FAQ
grok-voice-think-fast-2.0とgrok-voice-latestの違いは何ですか?
grok-voice-think-fast-2.0は特定のモデルバージョンであり、grok-voice-latestは現在それを指し示すエイリアスです。エイリアスは新しいリリースに更新されますが、日付付きの名前はテストしたバージョンに固定されます。
Grok Voice Think Fast 2.0はテキスト読み上げ(TTS)モデルですか?
いいえ。これはライブセッションで聞き取りと回答を行うモデルであり、音声を入力して音声で返答を生成します。用意されたテキストを音声に変換する場合はGrok Voice TTSを、録音を文字起こしする場合はGrok Voice STTを使用してください。
話し終わったことをどのように判断しますか?
セッションでサーバーサイドの音声アクティビティ検出を有効にすると、ユーザーのターンの終了を検知して返答を開始します。クライアント側でプッシュ・ツー・トーク機能がある場合は、自身でターンを管理することも可能です。
どの音声を使用できますか?
セッションではxAIの組み込み音声(デフォルトはeve)を選択するか、短い参照録音からクローンしたカスタム音声を使用できます。組み込み音声はサポートされているすべての言語に対応しています。
Grok Voice Think Fast 2.0 の料金はいくらですか?
TokenLab では Grok Voice Think Fast 2.0 は $0.001333 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Grok Voice Think Fast 2.0 はどのエンドポイントを使うべきですか?
Grok Voice Think Fast 2.0 のデフォルトは https://api.tokenlab.sh/v1/chat/completions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok Voice Think Fast 2.0 を比較する
ソース
2026/10/02 時点での評価