xAI: Grok TTS
grok-tts- 入力 / 出力
- $15.00 / $0.00
- モダリティ
- オーディオ
Grok TTS について
Grok TTSは、書かれたテキストを表現力豊かな音声に変換するxAIのテキスト読み上げ(Text-to-Speech)モデルです。このインターフェースはMP3形式の音声を返し、声を選択することができます。xAIは笑い声、ささやき声、一時停止などのインライン音声タグをサポートしており、スクリプトに読み上げの指示を含めることができます。音声による応答、ナレーション、多言語の音声出力に適しています。
得意なこと
- 豊富な表現力を持つ声のラインナップを提供しており、製品やキャラクターに合った声を選択できます。
- MP3形式の音声を返すため、変換なしでブラウザやアプリで再生可能です。
- xAIは、テキスト内で読み上げ方を調整するための笑い声、ささやき声、一時停止といったインラインタグをサポートしています。
- すべての内蔵音声はサポートされている全言語に対応しているため、一つの声で複数の言語を話すことができます。
- プレーンテキストを入力すると完成した音声ファイルが出力されるため、長いスクリプトの自動化もシンプルに行えます。
他のモデルを検討すべきケース
- このインターフェースからの出力はMP3のみであるため、電話用フォーマットが必要な場合は変換が必要です。
- ボイスクローンやライブストリーミング配信は別の機能であり、このリクエストには含まれません。
- 長いスクリプトはチャンクに分割する必要があり、人名や頭字語の発音を確認することをお勧めします。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
テキスト読み上げTokenLab エンドポイントPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "model": "grok-tts", "input": "Hello from TokenLab.", "voice": "alloy" }'
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
テキスト読み上げ
100万文字あたり- 公式価格
- 入力 $15.00 / 出力 $0.00
- Official
- 入力 $15.00 / 出力 $0.00
- 割引
- —
| 公式価格100万文字あたり | Official100万文字あたり | 割引 | |
|---|---|---|---|
| テキスト読み上げ | 入力 $15.00 / 出力 $0.00 | 入力 $15.00 / 出力 $0.00 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでGrok TTSを開き、プロンプトを編集・送信できます。
grok-ttsと/v1/audio/speechで音声をテスト。結果とコストを表示します。
ユースケース
音声アシスタント
チャットモデルからの応答を読み上げ、製品に合った声を選択します。
ナレーションとオーディオブック
記事、レッスン、章を音声ファイルに変換し、ペース調整が必要な箇所に一時停止タグを追加します。
多言語アナウンス
一貫したブランドイメージを保つため、一つの声を使用して同じメッセージを複数の言語で作成します。
プロンプト例
おかえりなさい! [pause] ご注文の商品が発送されました。木曜日に到着予定です。
この製品説明を穏やかで親しみやすいトーンで読み上げ、最後の行はささやいてください。
以下の段落をフランス語で、一定のペースでナレーションしてください。各文の後に短い一時停止を入れてください。
FAQ
Grok TTSとは何ですか?
xAIのテキスト読み上げモデルです。テキストを送信し、声を選択すると、MP3ファイルとして音声を受け取れます。書かれたテキストからの音声応答、ナレーション、多言語の音声出力向けに設計されています。
声を選択できますか?
はい。xAIは表現力豊かな声のラインナップを提供しており、デフォルトは「eve」です。声はリクエストオプションであるため、スクリプトに合わせて呼び出しごとに変更可能です。
感情を込めた読み上げに対応していますか?
xAIは、笑い声、ささやき声、一時停止などの効果のためのインライン音声タグをサポートしています。テキスト内の効果を入れたい場所に配置して、結果を確認してください。
どの言語を話せますか?
xAIは、内蔵されている声が利用可能なすべての言語に対応しているとしています。まずは短い文章でテストし、人名や数字の発音に注意してください。
どのような音声形式で出力されますか?
MP3形式で、ブラウザやモバイルアプリで直接再生できます。電話用音声など、別の形式が必要な場合は生成後にファイルを変換してください。標準的な音声ツールであれば変換可能です。
Grok TTS の料金はいくらですか?
TokenLab では Grok TTS は 入力 $15.00 / 出力 $0.00 100万文字あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Grok TTS はどのエンドポイントを使うべきですか?
Grok TTS のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok TTS はどの操作に対応していますか?
Grok TTS は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Grok TTS を比較する
ソース
2026/10/02 時点での評価