ByteDance: OmniHuman-1.5
omnihuman-1-5- 価格
- 価格 $0.1325
- モダリティ
- ビデオ
OmniHuman-1.5 について
OmniHuman-1.5は、ByteDanceのIntelligent Creation Labによるデジタルヒューマン動画モデルです。人物の画像1枚、音声クリップ、およびオプションのテキストプロンプトから、発話に合わせてリップシンク、ジェスチャー、身体の動きを行うアバター動画を生成します。複数の話者がいるシーンを含め、反応しているように見えるキャラクターのために構築されています。
得意なこと
- 静止画1枚をアニメーション化するため、その人物の撮影済み映像は不要です。
- リップシンクは提供された音声に従い、ジェスチャーは発話の意味に合わせて選択されます。
- オプションのテキストプロンプトにより、音声に加えてアクションやカメラの動きを制御できます。
- 2人の音声によって駆動されるシーンをサポートしており、キャラクター同士が反応し合う様子を生成できます。
他のモデルを検討すべきケース
- 音声トラックが必要です。話者がいないシーンのための一般的なテキストから動画への生成モデルではありません。
- 出力品質は参照画像に依存し、顔が切り取られていたり解像度が低い場合は、本人らしさの再現度が制限されます。
- 生成された人物や音声は同意に関する問題を引き起こす可能性があるため、権利を所有している画像と音声のみを使用してください。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
画像から動画へTokenLab エンドポイントPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
画像から動画へ
1秒あたり- 公式価格
- $0.1325
- Official
- $0.1325
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| 画像から動画へ | $0.1325 | $0.1325 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでOmniHuman-1.5を開き、プロンプトを編集・送信できます。
omnihuman-1-5と/v1/videos/generationsでimage-to-videoを実行。結果、ステータス、コストを表示します。
ユースケース
話すプレゼンター
ポートレート写真とナレーショントラックから、トレーニング、製品アップデート、解説用のスポークスパーソン動画を作成します。
キャラクターの対話
イラストや写真のキャラクターをアニメーション化し、短編ストーリーやソーシャルメディア用クリップのために台詞を話させます。
ローカライズされた動画
1人のプレゼンター画像と複数の言語で録音された音声を再利用し、それぞれに対応するリップシンクされたクリップを作成します。
プロンプト例
デスクに座った女性がカメラに向かって話し、穏やかなジェスチャーを行い、重要なポイントで軽く頷く
公園のベンチに座った2人の友人が互いに話し、話している相手の方を向く
歌手が小さなステージでパフォーマンスを行い、表情豊かな手の動きを見せ、カメラは固定されている
FAQ
OmniHuman-1.5はどのような入力を受け取りますか?
キャラクターの画像1枚、音声クリップ、およびオプションのテキストプロンプトです。画像はアイデンティティと外見を決定し、音声はリップシンクとタイミングを駆動し、プロンプトはアクションをガイドします。
2人以上の人物が登場する動画を生成できますか?
はい。ByteDanceは2人の話者による音声をサポートしているため、キャラクター間の相互作用を1つのクリップで生成でき、各人物の動きはそれぞれの発話に従います。
OmniHuman-1.5はどのようにアバターの動きを決定しますか?
ByteDanceの論文では、音声、画像、プロンプトからアクションを計画するマルチモーダル言語モデルと、動きをレンダリングする拡散トランスフォーマーについて説明されています。これは、ジェスチャーを単なるループではなく、内容に適合させることを目的としています。
これは一般的な動画生成モデルですか?
いいえ。音声に合わせて話したりパフォーマンスを行ったりする人物に特化しています。音声トラックのないシーン、風景、アクション映像には、一般的なテキストから動画、または画像から動画への生成モデルを使用してください。
OmniHuman-1.5 の料金はいくらですか?
TokenLab では OmniHuman-1.5 は $0.1325 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
OmniHuman-1.5 はどのエンドポイントを使うべきですか?
OmniHuman-1.5 のデフォルトは https://api.tokenlab.sh/v1/videos/generations です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
OmniHuman-1.5 はどの操作に対応していますか?
OmniHuman-1.5 は 画像から動画へ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
OmniHuman-1.5 を比較する
ソース
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
2026/10/02 時点での評価