xAI: Grok Voice STT
grok-voice-stt- 価格
- 価格 $0.000028
- モダリティ
- オーディオ
Grok Voice STT について
Grok Voice STTは、録音またはストリーミングされた音声をテキストの文字起こしに変換するxAIの音声認識モデルです。一般的な音声ファイル形式を受け入れ、単語レベルのタイムスタンプを返し、話者やチャンネルを分離し、言語ごとに数値や通貨をフォーマットします。キャプション、検索可能な会議記録、およびその後のテキスト分析に送る通話記録などに使用してください。
得意なこと
- 単語レベルのタイムスタンプにより、文字起こしからキャプション、特定の瞬間へのジャンプ検索、字幕ファイルの作成が容易になります。
- 話者分離(ダイアライゼーション)とマルチチャンネル文字起こしにより、会議や双方向の通話録音で誰が何を言ったかを分離します。
- 言語ヒントとカスタム用語リストにより、製品名や専門用語の認識精度を高めます。
- テキストフォーマット機能により、数値、日付、通貨をその言語の書き方に合わせて出力します。
他のモデルを検討すべきケース
- これは文字起こしのみを行います。音声からの要約、翻訳、または回答には、その後にテキストモデルが必要です。
- 非常にノイズの多い録音では、許容できる精度を得るために音声検出のしきい値を調整するか、よりクリアな入力が必要になる場合があります。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
音声からテキストへTokenLab エンドポイントPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
料金
1秒あたり- Official
- $0.0000281秒あたり
- 公式価格
- $0.0000281秒あたり
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| 価格 | $0.0000281秒あたり | $0.0000281秒あたり | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでGrok Voice STTを開き、プロンプトを編集・送信できます。
grok-voice-sttと/v1/audio/transcriptionsで音声をテスト。結果とコストを表示します。
ユースケース
会議の文字起こし
話者がラベル付けされた録音通話を文字起こしし、そのテキストを要約ツールに渡してアクションアイテムを抽出します。
動画の字幕
単語のタイミング情報を使用して、アップロードされた動画の音声トラックからタイムコード付きのキャプションを生成します。
コールセンターの品質レビュー
エージェントと顧客を別々のチャンネルに分けた2チャンネル録音を文字起こしし、コンプライアンスフレーズが含まれているかスキャンします。
プロンプト例
この45分間のポッドキャストエピソードを、単語のタイムスタンプと話者ラベル付きで英語で文字起こししてください。
添付の顧客通話を文字起こししてください。その際、「Zyntra」、「OmniPlan」、「SLA」という用語を認識の優先対象として使用してください。
このスペイン語のボイスメモをテキストに変換し、金額を通貨形式でフォーマットしてください。
FAQ
Grok Voice STTは何を行いますか?
音声をテキストに変換します。ファイルまたはストリーミング音声を送信すると、設定したオプションに応じて、単語レベルのタイムスタンプ、話者ラベル、チャンネルごとのテキストを含む文字起こしが返されます。
どの音声フォーマットを読み込めますか?
xAIはMP3、WAV、FLAC、Opusを含む12のフォーマットをリストしており、ファイルサイズの上限は500MBです。Raw PCM、mu-law、A-law音声には明示的なエンコーディングパラメータが必要です。
ライブ文字起こしをサポートしていますか?
はい。WebSocketエンドポイントが中間結果をストリーミングし、「Smart Turn」終了検出を使用して自然な休止と文の終わりを判別するため、早すぎる切断を防ぎます。
何言語に対応していますか?
xAIは、文字起こしおよび言語固有のフォーマットについて25以上の言語をドキュメント化しています。言語がわかっている場合は言語ヒントを渡すことで、認識の推測を回避できます。
話者を識別できますか?
はい。話者分離機能は録音内の話者にラベルを付け、マルチチャンネルモードは最大8つの独立したチャンネルを処理できるため、各当事者が別々のチャンネルにいる通話録音に適しています。
Grok Voice STT の料金はいくらですか?
TokenLab では Grok Voice STT は $0.000028 1秒あたり です。詳細は上の料金表を参照してください。
Grok Voice STT はどのエンドポイントを使うべきですか?
Grok Voice STT のデフォルトは https://api.tokenlab.sh/v1/audio/transcriptions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok Voice STT はどの操作に対応していますか?
Grok Voice STT は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Grok Voice STT を比較する
ソース
2026/10/02 時点での評価