每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

ByteDance: OmniHuman-1.5

OmniHuman-1.5 的价格、表现、能力和可直接使用的请求示例。
对比模型
omnihuman-1-5
可用ByteDance视频异步
价格
起 $0.1325
模态
视频

OmniHuman-1.5 简介

OmniHuman-1.5 是字节跳动 Intelligent Creation Lab 的数字人视频模型。给它一张人物图片、一段音频和可选的文字提示词,它会生成一段会说话或会表演的虚拟人视频,口型、手势和身体动作都跟着语音走。它适合需要让角色看起来在做出反应的场景,包括多人说话的画面。

擅长的任务

  • 只用一张静态图就能让人物动起来,不需要拍摄这个人的真实素材。
  • 口型跟随提供的音频,手势则按语音的含义来匹配。
  • 可选的文字提示词能在音频之外引导动作或镜头行为。
  • 支持由双人音频驱动的场景,角色之间会相互反应。

什么情况换别的模型

  • 必须有音轨,它不是通用的文生视频模型,不能用于没有人说话的场景。
  • 输出质量取决于参考图,脸部被裁切或分辨率低会限制身份还原度。
  • 生成的人物和声音涉及授权问题,只使用你有权使用的图片和音频。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    图生视频TokenLab 端点
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

图生视频

每秒
官方价格
$0.1325
Official
$0.1325
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

OmniHuman-1.5 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 omnihuman-1-5 完成一次 image-to-video,接口是 /v1/videos/generations。返回结果、状态和费用。

使用场景

  • 口播主持人

    把一张肖像和一段旁白做成发言人视频,用于培训、产品更新或讲解。

  • 角色对白

    让插画或照片里的角色说出剧本台词,用于短故事和社交短片。

  • 本地化视频

    同一张主持人图片搭配多种语言的录音,为每种语言生成口型匹配的片段。

提示词示例

一位女士坐在办公桌前对着镜头讲话,手势平静,在重点处轻轻点头

两个朋友坐在公园长椅上交谈,转向正在说话的人

歌手在小舞台上演唱,手部动作富有表现力,镜头保持稳定

FAQ

OmniHuman-1.5 接收哪些输入?

一张角色图片、一段音频,以及可选的文字提示词。图片决定身份和外貌,音频驱动口型和节奏,提示词可以引导动作。

能生成多人视频吗?

能。字节跳动介绍支持双人说话的音频,所以角色之间的互动可以在一个片段里生成,每个人的动作都跟随各自的语音。

OmniHuman-1.5 怎么决定虚拟人的动作?

字节跳动的论文描述了两部分:一个多模态语言模型根据音频、图像和提示词规划动作,一个扩散 Transformer 负责渲染运动。目的是让手势贴合内容,而不是千篇一律地循环。

它是通用的视频生成模型吗?

不是。它专门用于对着音频说话或表演的人物。没有驱动音频的场景、风景或动作画面,请用通用的文生视频或图生视频模型。

OmniHuman-1.5 的费用是多少?

在 TokenLab 上,OmniHuman-1.5 的价格为 $0.1325 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

OmniHuman-1.5 应该使用哪个端点?

OmniHuman-1.5 使用 https://api.tokenlab.sh/v1/videos/generations。代码写法见下方的请求示例。

OmniHuman-1.5 支持哪些操作?

OmniHuman-1.5 支持 图生视频。选了操作,上面会显示对应的端点和请求示例。

OmniHuman-1.5 对比

资料来源

审阅于 2026年10月2日

相关模型