Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

ByteDance: OmniHuman-1.5

Giá, hiệu suất, khả năng và yêu cầu sẵn sàng sử dụng cho OmniHuman-1.5.
So sánh mô hình
omnihuman-1-5
Sẵn sàngByteDanceTạo videoBất đồng bộ
Giá
Từ $0.1325
Phương thức
Tạo video

Về OmniHuman-1.5

OmniHuman-1.5 là một mô hình video người kỹ thuật số từ Phòng thí nghiệm Sáng tạo Thông minh của ByteDance. Từ một hình ảnh của một người, một đoạn âm thanh và một gợi ý văn bản tùy chọn, nó tạo ra một video avatar đang nói hoặc biểu diễn với khả năng đồng bộ môi, cử chỉ và chuyển động cơ thể theo lời nói. Nó được xây dựng cho các nhân vật trông như đang phản ứng, bao gồm cả các cảnh có nhiều hơn một người nói.

Ưu điểm

  • Tạo hoạt ảnh từ một hình ảnh tĩnh duy nhất, vì vậy không cần quay phim người thật.
  • Đồng bộ môi theo âm thanh được cung cấp, và các cử chỉ được chọn để phù hợp với ý nghĩa của lời nói.
  • Một gợi ý văn bản tùy chọn có thể điều khiển hành động hoặc hành vi camera bên cạnh âm thanh.
  • Hỗ trợ các cảnh được điều khiển bởi âm thanh của hai người, với các nhân vật phản ứng với nhau.

Khi nào nên chọn model khác

  • Nó cần một bản âm thanh; đây không phải là mô hình chuyển văn bản thành video chung cho các cảnh không có người nói.
  • Chất lượng đầu ra phụ thuộc vào hình ảnh tham chiếu, và khuôn mặt bị cắt hoặc độ phân giải thấp sẽ hạn chế độ trung thực của danh tính.
  • Người và giọng nói được tạo ra làm nảy sinh các vấn đề về sự đồng ý, vì vậy chỉ sử dụng hình ảnh và âm thanh mà bạn có quyền sử dụng.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Ảnh sang videoĐiểm cuối TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Ảnh sang video

mỗi giây
Giá niêm yết
$0.1325
Official
$0.1325
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở OmniHuman-1.5 trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi tạo với omnihuman-1-5 sử dụng image-to-video tại /v1/videos/generations. Hiển thị kết quả, trạng thái và chi phí.

Tình huống sử dụng

  • Người thuyết trình đang nói

    Biến một bức chân dung và một bản tường thuật thành video người phát ngôn cho đào tạo, cập nhật sản phẩm hoặc video giải thích.

  • Đối thoại nhân vật

    Tạo hoạt ảnh cho các nhân vật minh họa hoặc ảnh chụp đang nói một dòng kịch bản cho các câu chuyện ngắn và clip xã hội.

  • Video bản địa hóa

    Sử dụng lại một hình ảnh người thuyết trình với âm thanh được ghi bằng nhiều ngôn ngữ, tạo ra một clip đồng bộ môi phù hợp cho từng ngôn ngữ.

Ví dụ prompt

Một người phụ nữ tại bàn làm việc nói chuyện với camera, cử chỉ bình tĩnh, gật đầu nhẹ ở những điểm chính

Hai người bạn trên ghế công viên nói chuyện với nhau, quay về phía người đang nói

Ca sĩ biểu diễn trên một sân khấu nhỏ, cử động tay biểu cảm, camera giữ ổn định

FAQ

OmniHuman-1.5 nhận những đầu vào nào?

Một hình ảnh duy nhất của nhân vật, một đoạn âm thanh và tùy chọn là một gợi ý văn bản. Hình ảnh thiết lập danh tính và ngoại hình, âm thanh điều khiển đồng bộ môi và thời gian, và gợi ý có thể hướng dẫn hành động.

Nó có thể tạo video với nhiều hơn một người không?

Có. ByteDance mô tả hỗ trợ cho âm thanh với hai người nói, vì vậy sự tương tác giữa các nhân vật có thể được tạo trong một clip, và chuyển động của mỗi người tuân theo lời nói của chính họ.

OmniHuman-1.5 quyết định cách avatar di chuyển như thế nào?

Bài báo của ByteDance mô tả một mô hình ngôn ngữ đa phương thức lập kế hoạch hành động từ âm thanh, hình ảnh và gợi ý, cùng với một bộ khuếch tán biến đổi (diffusion transformer) để kết xuất chuyển động. Điều này nhằm làm cho các cử chỉ phù hợp với nội dung thay vì lặp lại một cách chung chung.

Đây có phải là một trình tạo video chung không?

Không. Nó chuyên biệt cho những người nói hoặc biểu diễn theo âm thanh. Đối với các cảnh quay, phong cảnh hoặc cảnh hành động không có bản âm thanh điều khiển, hãy sử dụng mô hình chuyển văn bản thành video hoặc hình ảnh thành video chung.

OmniHuman-1.5 có giá bao nhiêu?

Trên TokenLab, OmniHuman-1.5 có giá $0.1325 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

OmniHuman-1.5 nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/videos/generations làm mặc định cho OmniHuman-1.5. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

OmniHuman-1.5 hỗ trợ những thao tác nào?

OmniHuman-1.5 hỗ trợ Ảnh sang video. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh OmniHuman-1.5

Nguồn

Đánh giá ngày 2 thg 10, 2026

Mô hình liên quan