- 價格
- 起 $0.1325
- 模態
- 影片
關於 OmniHuman-1.5
OmniHuman-1.5 是來自字節跳動智慧創作實驗室的數位人影片模型。透過一張人物圖像、一段音訊剪輯以及可選的文字提示詞,它能生成帶有口型同步、手勢和隨語音變化的肢體動作的說話或表演頭像影片。它專為看起來像是在互動的角色而設計,包括包含多位說話者的場景。
適用場景
- 可將單張靜態圖像製作成動畫,因此無需拍攝人物的實拍影片。
- 口型同步會跟隨提供的音訊,手勢則會根據語音含義進行選擇。
- 除了音訊外,可選的文字提示詞還能引導動作或攝影機行為。
- 支援由雙人音訊驅動的場景,角色之間會互相產生互動反應。
其他選擇建議
- 它需要音訊軌道;這不是一個針對無說話者場景的通用文字轉影片模型。
- 輸出品質取決於參考圖像,裁剪過或低解析度的臉部會限制身份還原度。
- 生成的虛擬人物與聲音涉及同意權問題,因此請僅使用您擁有權利的圖像與音訊。
入門指南
建立 API 金鑰
請至 Console 建立金鑰,即可在平台上使用各類模型。
發送您的第一個請求
複製您所選語言的範例,並針對端點執行它。
圖生影TokenLab 端點POST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
定價
Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。
圖生影
每秒- Official 定價
- $0.1325
- Official
- $0.1325
- 折扣
- —
| Official 定價每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 圖生影 | $0.1325 | $0.1325 | — |
使用量與活動
成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。
用量與可用性
過去 24 小時- 請求數
- 成功率
- P95 延遲
- 總 Token 用量
資料基於彙總的使用者請求,不包含狀態檢查。
直接在 Console 裡試
在 Console 中開啟 OmniHuman-1.5,並準備好編輯或發送提示詞。
協助我使用 omnihuman-1-5 透過 /v1/videos/generations 執行 image-to-video,並顯示結果、狀態與成本。
應用情境
說話的演講者
將肖像與旁白音軌轉化為用於培訓、產品更新或說明影片的發言人影片。
角色對話
為短篇故事和社群短片製作插畫或攝影角色說出腳本台詞的動畫。
在地化影片
重複使用同一個演講者圖像,搭配以多種語言錄製的音訊,為每種語言製作對應的口型同步短片。
提示詞範例
一位坐在桌前的女性對著鏡頭說話,動作冷靜,在關鍵點輕微點頭
公園長椅上的兩位朋友互相交談,轉向正在說話的人
歌手在小舞台上表演,手部動作豐富,攝影機保持穩定
FAQ
OmniHuman-1.5 接受哪些輸入?
一張角色圖像、一段音訊剪輯,以及可選的文字提示詞。圖像設定身份與外觀,音訊驅動口型同步與時序,提示詞則可引導動作。
它能生成包含多於一個人的影片嗎?
可以。字節跳動說明其支援雙人音訊,因此可以在一個剪輯中生成角色間的互動,且每個人的動作都會跟隨其各自的語音。
OmniHuman-1.5 如何決定頭像的動作?
字節跳動的論文描述了一個多模態語言模型,它能從音訊、圖像和提示詞中規劃動作,並透過擴散 Transformer(diffusion transformer)來渲染動作。這旨在讓手勢符合內容,而非進行通用的循環動作。
它是通用的影片生成器嗎?
不是。它專門用於說話或隨音訊表演的人物。對於沒有驅動音軌的場景、風景或動作影片,請使用通用的文字轉影片或圖像轉影片模型。
OmniHuman-1.5 的費用是多少?
在 TokenLab 上,OmniHuman-1.5 價格為 $0.1325 每秒。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。
OmniHuman-1.5 應該使用哪一個端點?
請使用 https://api.tokenlab.sh/v1/videos/generations 進行 OmniHuman-1.5 的呼叫。下方的請求範例展示了對應的程式碼格式。
OmniHuman-1.5 支援哪些操作?
OmniHuman-1.5 支援 圖生影。請在上方選擇一項操作以查看其端點與請求範例。
比較 OmniHuman-1.5
來源
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
更新於 2026年10月2日