ByteDance: OmniHuman-1.5
omnihuman-1-5- Giá
- Từ $0.1325
- Phương thức
- Tạo video
Về OmniHuman-1.5
OmniHuman-1.5 là một mô hình video người kỹ thuật số từ Phòng thí nghiệm Sáng tạo Thông minh của ByteDance. Từ một hình ảnh của một người, một đoạn âm thanh và một gợi ý văn bản tùy chọn, nó tạo ra một video avatar đang nói hoặc biểu diễn với khả năng đồng bộ môi, cử chỉ và chuyển động cơ thể theo lời nói. Nó được xây dựng cho các nhân vật trông như đang phản ứng, bao gồm cả các cảnh có nhiều hơn một người nói.
Ưu điểm
- Tạo hoạt ảnh từ một hình ảnh tĩnh duy nhất, vì vậy không cần quay phim người thật.
- Đồng bộ môi theo âm thanh được cung cấp, và các cử chỉ được chọn để phù hợp với ý nghĩa của lời nói.
- Một gợi ý văn bản tùy chọn có thể điều khiển hành động hoặc hành vi camera bên cạnh âm thanh.
- Hỗ trợ các cảnh được điều khiển bởi âm thanh của hai người, với các nhân vật phản ứng với nhau.
Khi nào nên chọn model khác
- Nó cần một bản âm thanh; đây không phải là mô hình chuyển văn bản thành video chung cho các cảnh không có người nói.
- Chất lượng đầu ra phụ thuộc vào hình ảnh tham chiếu, và khuôn mặt bị cắt hoặc độ phân giải thấp sẽ hạn chế độ trung thực của danh tính.
- Người và giọng nói được tạo ra làm nảy sinh các vấn đề về sự đồng ý, vì vậy chỉ sử dụng hình ảnh và âm thanh mà bạn có quyền sử dụng.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Ảnh sang videoĐiểm cuối TokenLabPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Ảnh sang video
mỗi giây- Giá niêm yết
- $0.1325
- Official
- $0.1325
- Giảm giá
- —
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Ảnh sang video | $0.1325 | $0.1325 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở OmniHuman-1.5 trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi tạo với omnihuman-1-5 sử dụng image-to-video tại /v1/videos/generations. Hiển thị kết quả, trạng thái và chi phí.
Tình huống sử dụng
Người thuyết trình đang nói
Biến một bức chân dung và một bản tường thuật thành video người phát ngôn cho đào tạo, cập nhật sản phẩm hoặc video giải thích.
Đối thoại nhân vật
Tạo hoạt ảnh cho các nhân vật minh họa hoặc ảnh chụp đang nói một dòng kịch bản cho các câu chuyện ngắn và clip xã hội.
Video bản địa hóa
Sử dụng lại một hình ảnh người thuyết trình với âm thanh được ghi bằng nhiều ngôn ngữ, tạo ra một clip đồng bộ môi phù hợp cho từng ngôn ngữ.
Ví dụ prompt
Một người phụ nữ tại bàn làm việc nói chuyện với camera, cử chỉ bình tĩnh, gật đầu nhẹ ở những điểm chính
Hai người bạn trên ghế công viên nói chuyện với nhau, quay về phía người đang nói
Ca sĩ biểu diễn trên một sân khấu nhỏ, cử động tay biểu cảm, camera giữ ổn định
FAQ
OmniHuman-1.5 nhận những đầu vào nào?
Một hình ảnh duy nhất của nhân vật, một đoạn âm thanh và tùy chọn là một gợi ý văn bản. Hình ảnh thiết lập danh tính và ngoại hình, âm thanh điều khiển đồng bộ môi và thời gian, và gợi ý có thể hướng dẫn hành động.
Nó có thể tạo video với nhiều hơn một người không?
Có. ByteDance mô tả hỗ trợ cho âm thanh với hai người nói, vì vậy sự tương tác giữa các nhân vật có thể được tạo trong một clip, và chuyển động của mỗi người tuân theo lời nói của chính họ.
OmniHuman-1.5 quyết định cách avatar di chuyển như thế nào?
Bài báo của ByteDance mô tả một mô hình ngôn ngữ đa phương thức lập kế hoạch hành động từ âm thanh, hình ảnh và gợi ý, cùng với một bộ khuếch tán biến đổi (diffusion transformer) để kết xuất chuyển động. Điều này nhằm làm cho các cử chỉ phù hợp với nội dung thay vì lặp lại một cách chung chung.
Đây có phải là một trình tạo video chung không?
Không. Nó chuyên biệt cho những người nói hoặc biểu diễn theo âm thanh. Đối với các cảnh quay, phong cảnh hoặc cảnh hành động không có bản âm thanh điều khiển, hãy sử dụng mô hình chuyển văn bản thành video hoặc hình ảnh thành video chung.
OmniHuman-1.5 có giá bao nhiêu?
Trên TokenLab, OmniHuman-1.5 có giá $0.1325 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
OmniHuman-1.5 nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/videos/generations làm mặc định cho OmniHuman-1.5. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
OmniHuman-1.5 hỗ trợ những thao tác nào?
OmniHuman-1.5 hỗ trợ Ảnh sang video. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh OmniHuman-1.5
Nguồn
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
Đánh giá ngày 2 thg 10, 2026