各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

xAI: Grok STT

Grok STTは、アップロードされた録音データのためのxAIの音声認識(Speech-to-Text)サービスです。この統合機能は、報告された音声期間を伴うバッチ文字起こしを提供します。リアルタイムストリーミングサービスについては、別のインターフェースおよび価格契約が適用されます。
モデルを比較
grok-stt
利用可能xAI音声テキスト変換同期
価格
価格 $0.000028
モダリティ
オーディオ

Grok STT について

Grok STTは、録音された音声をテキストに変換するxAIの音声認識(Speech-to-Text)サービスです。このモデルはアップロードされた録音データをバッチ処理し、文字起こし結果をJSON形式で返します。xAIは、この文字起こしサービスで25言語のサポートを明記しています。リアルタイムのストリーミング文字起こしは別のxAIインターフェースとなるため、このモデルは会議、通話、インタビューなど、すでに存在する音声ファイルに適しています。

得意なこと

  • アップロードされた音声ファイルを1回のリクエストで文字起こしし、JSON形式の結果を返します。
  • xAIは25言語のサポートを明記しており、多言語の録音データにも幅広く対応しています。
  • 会議のアーカイブ、通話録音、インタビューの蓄積データといったバッチ処理に適しています。
  • 標準的な音声文字起こしのリクエスト形式で動作するため、既存のWhisper形式のクライアントであれば、わずかな変更で対応可能です。
  • 長い録音データは短いチャンクに分割することなく、単一のファイルアップロードとして処理されます。

他のモデルを検討すべきケース

  • バッチ処理専用です。ライブキャプションや低遅延のストリーミングには、別のリアルタイムインターフェースが必要です。
  • 出力はJSON形式の文字起こしテキストであり、要約や翻訳機能は組み込まれていません。
  • 精度は音声品質に依存するため、ノイズが多い場合や話し声が重なっている場合は、クリーンアップや確認が必要になることがあります。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    音声からテキストへTokenLab エンドポイント
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

音声からテキストへ

1秒あたり
公式価格
$0.00002778
Official
$0.00002778
割引
—

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでGrok STTを開き、プロンプトを編集・送信できます。

grok-sttと/v1/audio/transcriptionsで音声をテスト。結果とコストを表示します。

ユースケース

  • 会議の文字起こし

    録音された通話や会議をアップロードしてテキストを保存することで、チームによる検索や、要約モデルへの入力が可能になります。

  • インタビューやポッドキャストのアーカイブ

    蓄積された録音データをテキストに変換し、編集、引用、番組ノートの作成に活用できます。

  • サポート通話のレビュー

    顧客との通話を一括で文字起こしし、品質管理チームが問題点やトピックをスキャンできるようにします。

プロンプト例

この45分間のチーム会議の録音を英語で文字起こししてください。

添付の顧客通話を文字起こししてください。話者はスペイン語で話しています。

この録音された講義をテキストに変換して、光合成に関するセクションを検索できるようにしてください。

FAQ

Grok STTとは何ですか?

xAIの音声認識サービスです。アップロードされた録音データを受け取り、文字起こし結果をJSON形式で返します。ライブではなくバッチモードで動作するため、会議、通話、インタビューなど、すでに手元にある録音データにご利用ください。

どの言語に対応していますか?

xAIは文字起こしサービスで25言語のサポートを明記しています。言語や録音品質によって精度が異なるため、まずは短いサンプルでテストしてください。アクセントも結果に影響します。

Grok STTでライブ音声を文字起こしできますか?

いいえ。アップロードされたファイルのみを処理するため、通話や会議が終了した後にご利用ください。xAIは別のインターフェースを通じてストリーミング文字起こしを提供しており、ライブキャプションにはこのモデルではなく、そのインターフェースが必要です。

どのような形式で出力されますか?

文字起こしテキストを含むJSONレスポンスです。そのテキストを言語モデルに渡して、要約やアクションアイテムの抽出、あるいは他言語への翻訳を行うことができます。

Whisperと何が違いますか?

どちらも同じリクエスト形式でアップロードされた音声を文字起こしします。対応言語や音声タイプごとの精度が異なるため、お手元の録音データのサンプルで両方を実行し、文字起こし結果を比較してください。

Grok STT の料金はいくらですか?

TokenLab では Grok STT は $0.00002778 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。

Grok STT はどのエンドポイントを使うべきですか?

Grok STT のデフォルトは https://api.tokenlab.sh/v1/audio/transcriptions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

Grok STT はどの操作に対応していますか?

Grok STT は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

Grok STT を比較する

ソース

2026/10/02 時点での評価

Grok Voice の他のモデル

関連モデル