xAI: Grok Voice TTS
grok-voice-tts- 入力 / 出力
- $15.00 / $0.00
- モダリティ
- オーディオ
Grok Voice TTS について
Grok Voice TTSはxAIのテキスト読み上げモデルであり、書き込まれたテキストを選択した音声と言語で音声出力します。一時停止、笑い声、ささやき声などのインラインタグで話し方を調整できます。ナレーション、音声通知、およびライブ会話が不要なローカライズされた音声回答などに使用してください。
得意なこと
- [pause]や[laugh]などのインライン音声タグ、およびwhisperのようなラップタグを使用して、テキスト内で直接話し方を制御できます。
- 組み込み音声はすべてサポートされている言語を話すため、同じコンテンツのローカライズ版であっても、一つの音声アイデンティティを維持できます。
- カスタム音声は、ブランドやキャラクターの声として、短い参照クリップからクローン作成できます。
- キャプションや唇の動きを音声と同期させるために、文字単位のタイムスタンプを取得できます。
他のモデルを検討すべきケース
- これは固定テキストを読み上げるモデルです。話し手が割り込んだり返答したりする必要がある場合は、会話型音声モデルを使用してください。
- 長いスクリプトの出力品質はソーステキストの句読点やタグに依存するため、編集されていない機械的なテキストは平坦に聞こえる場合があります。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
テキスト読み上げTokenLab エンドポイントPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
料金
100万文字あたり- Official
- 入力$15.00/100万文字出力$0.00/100万文字
- 公式価格
- 入力$15.00/100万文字出力$0.00/100万文字
| 公式価格100万文字あたり | Official100万文字あたり | 割引 | |
|---|---|---|---|
| 入力 | $15.00 | $15.00 | — |
| 出力 | $0.00 | $0.00 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでGrok Voice TTSを開き、プロンプトを編集・送信できます。
grok-voice-ttsと/v1/audio/speechで音声をテスト。結果とコストを表示します。
ユースケース
ナレーション付き記事やレッスン
完成した記事やコースのスクリプトを音声トラックに変換し、一時停止を使用してセクションを区切ります。
音声アラート
注文状況の更新や安全に関する通知を、電話用コーデックを通じてユーザーの言語で読み上げます。
ローカライズされた製品ビデオ
同じスクリプトを一つの選択した音声で複数の言語で読み上げ、タイムスタンプを使用してキャプションを合わせます。
プロンプト例
この段落を温かみのある安定した声で読み上げ、各文の後に短い[pause]を入れてください。
以下の通知をフランス語で読み上げ、次に同じ声を使ってドイツ語で繰り返してください。
<whisper>荷物が発送されました。</whisper> [pause] 木曜日に到着予定です。
FAQ
Grok Voice TTSは何をしますか?
テキストを音声に変換します。音声、言語コード(オプション)、出力形式を選択すると、インラインで記述した表現タグを含め、テキストに対応する音声が返されます。
どのオーディオ形式を出力できますか?
MP3、WAV、RAW PCMに加え、電話用コーデックのmu-lawおよびA-lawに対応しており、サンプルレートは8kHzから48kHzまで選択可能です。電話用コーデックは電話システムに適しており、MP3はWebやモバイル再生に適しています。
何ヶ国語を話せますか?
xAIはBCP-47コードで選択された20言語に対応しており、自動言語検出も利用可能です。各組み込み音声はサポートされているすべての言語を話せるため、言語を切り替える際に新しい音声を選択する必要はありません。
テキストがまだ届いている最中に音声をストリーミングできますか?
はい。WebSocketエンドポイントはテキストが送信されると同時にリアルタイムで音声を生成します。これは、別のモデルがまだ返答を生成している最中に役立ちます。
誤った発音を修正できますか?
はい。発音の置き換え機能により、書き言葉の用語をどのように発音すべきかをマッピングできるため、表示テキストを編集することなくブランド名や頭字語を正しく発音させることができます。
Grok Voice TTS の料金はいくらですか?
TokenLab では Grok Voice TTS は 入力 $15.00 / 出力 $0.00 100万文字あたり です。詳細は上の料金表を参照してください。
Grok Voice TTS はどのエンドポイントを使うべきですか?
Grok Voice TTS のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok Voice TTS はどの操作に対応していますか?
Grok Voice TTS は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Grok Voice TTS を比較する
ソース
2026/10/02 時点での評価