為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

ByteDance: OmniHuman-1.5

OmniHuman-1.5 的價格、效能、功能與即用型請求範例。
比較模型
omnihuman-1-5
可用ByteDance影片非同步
價格
起 $0.1325
模態
影片

關於 OmniHuman-1.5

OmniHuman-1.5 是來自字節跳動智慧創作實驗室的數位人影片模型。透過一張人物圖像、一段音訊剪輯以及可選的文字提示詞,它能生成帶有口型同步、手勢和隨語音變化的肢體動作的說話或表演頭像影片。它專為看起來像是在互動的角色而設計,包括包含多位說話者的場景。

適用場景

  • 可將單張靜態圖像製作成動畫,因此無需拍攝人物的實拍影片。
  • 口型同步會跟隨提供的音訊,手勢則會根據語音含義進行選擇。
  • 除了音訊外,可選的文字提示詞還能引導動作或攝影機行為。
  • 支援由雙人音訊驅動的場景,角色之間會互相產生互動反應。

其他選擇建議

  • 它需要音訊軌道;這不是一個針對無說話者場景的通用文字轉影片模型。
  • 輸出品質取決於參考圖像,裁剪過或低解析度的臉部會限制身份還原度。
  • 生成的虛擬人物與聲音涉及同意權問題,因此請僅使用您擁有權利的圖像與音訊。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    圖生影TokenLab 端點
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

圖生影

每秒
Official 定價
$0.1325
Official
$0.1325
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 OmniHuman-1.5,並準備好編輯或發送提示詞。

協助我使用 omnihuman-1-5 透過 /v1/videos/generations 執行 image-to-video,並顯示結果、狀態與成本。

應用情境

  • 說話的演講者

    將肖像與旁白音軌轉化為用於培訓、產品更新或說明影片的發言人影片。

  • 角色對話

    為短篇故事和社群短片製作插畫或攝影角色說出腳本台詞的動畫。

  • 在地化影片

    重複使用同一個演講者圖像,搭配以多種語言錄製的音訊,為每種語言製作對應的口型同步短片。

提示詞範例

一位坐在桌前的女性對著鏡頭說話,動作冷靜,在關鍵點輕微點頭

公園長椅上的兩位朋友互相交談,轉向正在說話的人

歌手在小舞台上表演,手部動作豐富,攝影機保持穩定

FAQ

OmniHuman-1.5 接受哪些輸入?

一張角色圖像、一段音訊剪輯,以及可選的文字提示詞。圖像設定身份與外觀,音訊驅動口型同步與時序,提示詞則可引導動作。

它能生成包含多於一個人的影片嗎?

可以。字節跳動說明其支援雙人音訊,因此可以在一個剪輯中生成角色間的互動,且每個人的動作都會跟隨其各自的語音。

OmniHuman-1.5 如何決定頭像的動作?

字節跳動的論文描述了一個多模態語言模型,它能從音訊、圖像和提示詞中規劃動作,並透過擴散 Transformer(diffusion transformer)來渲染動作。這旨在讓手勢符合內容,而非進行通用的循環動作。

它是通用的影片生成器嗎?

不是。它專門用於說話或隨音訊表演的人物。對於沒有驅動音軌的場景、風景或動作影片,請使用通用的文字轉影片或圖像轉影片模型。

OmniHuman-1.5 的費用是多少?

在 TokenLab 上,OmniHuman-1.5 價格為 $0.1325 每秒。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

OmniHuman-1.5 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/videos/generations 進行 OmniHuman-1.5 的呼叫。下方的請求範例展示了對應的程式碼格式。

OmniHuman-1.5 支援哪些操作?

OmniHuman-1.5 支援 圖生影。請在上方選擇一項操作以查看其端點與請求範例。

比較 OmniHuman-1.5

來源

更新於 2026年10月2日

相關模型