各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

xAI: Grok Voice STT

Grok Voice STTは、録音された音声をテキストに変換します。言語ヒントとタイムスタンプ制御により、キャプション、検索、またはその後のテキスト分析ステップに供給する文字起こしに役立ちます。
モデルを比較
grok-voice-stt
利用可能xAI音声テキスト変換同期
価格
価格 $0.000028
モダリティ
オーディオ

Grok Voice STT について

Grok Voice STTは、録音またはストリーミングされた音声をテキストの文字起こしに変換するxAIの音声認識モデルです。一般的な音声ファイル形式を受け入れ、単語レベルのタイムスタンプを返し、話者やチャンネルを分離し、言語ごとに数値や通貨をフォーマットします。キャプション、検索可能な会議記録、およびその後のテキスト分析に送る通話記録などに使用してください。

得意なこと

  • 単語レベルのタイムスタンプにより、文字起こしからキャプション、特定の瞬間へのジャンプ検索、字幕ファイルの作成が容易になります。
  • 話者分離(ダイアライゼーション)とマルチチャンネル文字起こしにより、会議や双方向の通話録音で誰が何を言ったかを分離します。
  • 言語ヒントとカスタム用語リストにより、製品名や専門用語の認識精度を高めます。
  • テキストフォーマット機能により、数値、日付、通貨をその言語の書き方に合わせて出力します。

他のモデルを検討すべきケース

  • これは文字起こしのみを行います。音声からの要約、翻訳、または回答には、その後にテキストモデルが必要です。
  • 非常にノイズの多い録音では、許容できる精度を得るために音声検出のしきい値を調整するか、よりクリアな入力が必要になる場合があります。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    音声からテキストへTokenLab エンドポイント
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

料金

1秒あたり
Official
$0.0000281秒あたり
公式価格
$0.0000281秒あたり

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでGrok Voice STTを開き、プロンプトを編集・送信できます。

grok-voice-sttと/v1/audio/transcriptionsで音声をテスト。結果とコストを表示します。

ユースケース

  • 会議の文字起こし

    話者がラベル付けされた録音通話を文字起こしし、そのテキストを要約ツールに渡してアクションアイテムを抽出します。

  • 動画の字幕

    単語のタイミング情報を使用して、アップロードされた動画の音声トラックからタイムコード付きのキャプションを生成します。

  • コールセンターの品質レビュー

    エージェントと顧客を別々のチャンネルに分けた2チャンネル録音を文字起こしし、コンプライアンスフレーズが含まれているかスキャンします。

プロンプト例

この45分間のポッドキャストエピソードを、単語のタイムスタンプと話者ラベル付きで英語で文字起こししてください。

添付の顧客通話を文字起こししてください。その際、「Zyntra」、「OmniPlan」、「SLA」という用語を認識の優先対象として使用してください。

このスペイン語のボイスメモをテキストに変換し、金額を通貨形式でフォーマットしてください。

FAQ

Grok Voice STTは何を行いますか?

音声をテキストに変換します。ファイルまたはストリーミング音声を送信すると、設定したオプションに応じて、単語レベルのタイムスタンプ、話者ラベル、チャンネルごとのテキストを含む文字起こしが返されます。

どの音声フォーマットを読み込めますか?

xAIはMP3、WAV、FLAC、Opusを含む12のフォーマットをリストしており、ファイルサイズの上限は500MBです。Raw PCM、mu-law、A-law音声には明示的なエンコーディングパラメータが必要です。

ライブ文字起こしをサポートしていますか?

はい。WebSocketエンドポイントが中間結果をストリーミングし、「Smart Turn」終了検出を使用して自然な休止と文の終わりを判別するため、早すぎる切断を防ぎます。

何言語に対応していますか?

xAIは、文字起こしおよび言語固有のフォーマットについて25以上の言語をドキュメント化しています。言語がわかっている場合は言語ヒントを渡すことで、認識の推測を回避できます。

話者を識別できますか?

はい。話者分離機能は録音内の話者にラベルを付け、マルチチャンネルモードは最大8つの独立したチャンネルを処理できるため、各当事者が別々のチャンネルにいる通話録音に適しています。

Grok Voice STT の料金はいくらですか?

TokenLab では Grok Voice STT は $0.000028 1秒あたり です。詳細は上の料金表を参照してください。

Grok Voice STT はどのエンドポイントを使うべきですか?

Grok Voice STT のデフォルトは https://api.tokenlab.sh/v1/audio/transcriptions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

Grok Voice STT はどの操作に対応していますか?

Grok Voice STT は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

Grok Voice STT を比較する

ソース

2026/10/02 時点での評価

Grok Voice の他のモデル

関連モデル