xAI: Grok STT
grok-stt- 価格
- 価格 $0.000028
- モダリティ
- オーディオ
Grok STT について
Grok STTは、録音された音声をテキストに変換するxAIの音声認識(Speech-to-Text)サービスです。このモデルはアップロードされた録音データをバッチ処理し、文字起こし結果をJSON形式で返します。xAIは、この文字起こしサービスで25言語のサポートを明記しています。リアルタイムのストリーミング文字起こしは別のxAIインターフェースとなるため、このモデルは会議、通話、インタビューなど、すでに存在する音声ファイルに適しています。
得意なこと
- アップロードされた音声ファイルを1回のリクエストで文字起こしし、JSON形式の結果を返します。
- xAIは25言語のサポートを明記しており、多言語の録音データにも幅広く対応しています。
- 会議のアーカイブ、通話録音、インタビューの蓄積データといったバッチ処理に適しています。
- 標準的な音声文字起こしのリクエスト形式で動作するため、既存のWhisper形式のクライアントであれば、わずかな変更で対応可能です。
- 長い録音データは短いチャンクに分割することなく、単一のファイルアップロードとして処理されます。
他のモデルを検討すべきケース
- バッチ処理専用です。ライブキャプションや低遅延のストリーミングには、別のリアルタイムインターフェースが必要です。
- 出力はJSON形式の文字起こしテキストであり、要約や翻訳機能は組み込まれていません。
- 精度は音声品質に依存するため、ノイズが多い場合や話し声が重なっている場合は、クリーンアップや確認が必要になることがあります。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
音声からテキストへTokenLab エンドポイントPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-stt" \ -F language="en"
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
音声からテキストへ
1秒あたり- 公式価格
- $0.00002778
- Official
- $0.00002778
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| 音声からテキストへ | $0.00002778 | $0.00002778 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでGrok STTを開き、プロンプトを編集・送信できます。
grok-sttと/v1/audio/transcriptionsで音声をテスト。結果とコストを表示します。
ユースケース
会議の文字起こし
録音された通話や会議をアップロードしてテキストを保存することで、チームによる検索や、要約モデルへの入力が可能になります。
インタビューやポッドキャストのアーカイブ
蓄積された録音データをテキストに変換し、編集、引用、番組ノートの作成に活用できます。
サポート通話のレビュー
顧客との通話を一括で文字起こしし、品質管理チームが問題点やトピックをスキャンできるようにします。
プロンプト例
この45分間のチーム会議の録音を英語で文字起こししてください。
添付の顧客通話を文字起こししてください。話者はスペイン語で話しています。
この録音された講義をテキストに変換して、光合成に関するセクションを検索できるようにしてください。
FAQ
Grok STTとは何ですか?
xAIの音声認識サービスです。アップロードされた録音データを受け取り、文字起こし結果をJSON形式で返します。ライブではなくバッチモードで動作するため、会議、通話、インタビューなど、すでに手元にある録音データにご利用ください。
どの言語に対応していますか?
xAIは文字起こしサービスで25言語のサポートを明記しています。言語や録音品質によって精度が異なるため、まずは短いサンプルでテストしてください。アクセントも結果に影響します。
Grok STTでライブ音声を文字起こしできますか?
いいえ。アップロードされたファイルのみを処理するため、通話や会議が終了した後にご利用ください。xAIは別のインターフェースを通じてストリーミング文字起こしを提供しており、ライブキャプションにはこのモデルではなく、そのインターフェースが必要です。
どのような形式で出力されますか?
文字起こしテキストを含むJSONレスポンスです。そのテキストを言語モデルに渡して、要約やアクションアイテムの抽出、あるいは他言語への翻訳を行うことができます。
Whisperと何が違いますか?
どちらも同じリクエスト形式でアップロードされた音声を文字起こしします。対応言語や音声タイプごとの精度が異なるため、お手元の録音データのサンプルで両方を実行し、文字起こし結果を比較してください。
Grok STT の料金はいくらですか?
TokenLab では Grok STT は $0.00002778 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Grok STT はどのエンドポイントを使うべきですか?
Grok STT のデフォルトは https://api.tokenlab.sh/v1/audio/transcriptions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Grok STT はどの操作に対応していますか?
Grok STT は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Grok STT を比較する
ソース
2026/10/02 時点での評価