- 价格
- 起 $0.1325
- 模态
- 视频
OmniHuman-1.5 简介
OmniHuman-1.5 是字节跳动 Intelligent Creation Lab 的数字人视频模型。给它一张人物图片、一段音频和可选的文字提示词,它会生成一段会说话或会表演的虚拟人视频,口型、手势和身体动作都跟着语音走。它适合需要让角色看起来在做出反应的场景,包括多人说话的画面。
擅长的任务
- 只用一张静态图就能让人物动起来,不需要拍摄这个人的真实素材。
- 口型跟随提供的音频,手势则按语音的含义来匹配。
- 可选的文字提示词能在音频之外引导动作或镜头行为。
- 支持由双人音频驱动的场景,角色之间会相互反应。
什么情况换别的模型
- 必须有音轨,它不是通用的文生视频模型,不能用于没有人说话的场景。
- 输出质量取决于参考图,脸部被裁切或分辨率低会限制身份还原度。
- 生成的人物和声音涉及授权问题,只使用你有权使用的图片和音频。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
图生视频TokenLab 端点POST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
图生视频
每秒- 官方价格
- $0.1325
- Official
- $0.1325
- 折扣
- —
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 图生视频 | $0.1325 | $0.1325 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
OmniHuman-1.5 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 omnihuman-1-5 完成一次 image-to-video,接口是 /v1/videos/generations。返回结果、状态和费用。
使用场景
口播主持人
把一张肖像和一段旁白做成发言人视频,用于培训、产品更新或讲解。
角色对白
让插画或照片里的角色说出剧本台词,用于短故事和社交短片。
本地化视频
同一张主持人图片搭配多种语言的录音,为每种语言生成口型匹配的片段。
提示词示例
一位女士坐在办公桌前对着镜头讲话,手势平静,在重点处轻轻点头
两个朋友坐在公园长椅上交谈,转向正在说话的人
歌手在小舞台上演唱,手部动作富有表现力,镜头保持稳定
FAQ
OmniHuman-1.5 接收哪些输入?
一张角色图片、一段音频,以及可选的文字提示词。图片决定身份和外貌,音频驱动口型和节奏,提示词可以引导动作。
能生成多人视频吗?
能。字节跳动介绍支持双人说话的音频,所以角色之间的互动可以在一个片段里生成,每个人的动作都跟随各自的语音。
OmniHuman-1.5 怎么决定虚拟人的动作?
字节跳动的论文描述了两部分:一个多模态语言模型根据音频、图像和提示词规划动作,一个扩散 Transformer 负责渲染运动。目的是让手势贴合内容,而不是千篇一律地循环。
它是通用的视频生成模型吗?
不是。它专门用于对着音频说话或表演的人物。没有驱动音频的场景、风景或动作画面,请用通用的文生视频或图生视频模型。
OmniHuman-1.5 的费用是多少?
在 TokenLab 上,OmniHuman-1.5 的价格为 $0.1325 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
OmniHuman-1.5 应该使用哪个端点?
OmniHuman-1.5 使用 https://api.tokenlab.sh/v1/videos/generations。代码写法见下方的请求示例。
OmniHuman-1.5 支持哪些操作?
OmniHuman-1.5 支持 图生视频。选了操作,上面会显示对应的端点和请求示例。
OmniHuman-1.5 对比
资料来源
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
审阅于 2026年10月2日