ByteDance: OmniHuman-1.5
omnihuman-1-5- 가격
- 부터 $0.1325
- 모달리티
- 비디오
OmniHuman-1.5 소개
OmniHuman-1.5는 ByteDance의 Intelligent Creation Lab에서 개발한 디지털 휴먼 비디오 모델입니다. 인물 사진 한 장과 오디오 클립, 선택적인 텍스트 프롬프트를 입력하면, 음성에 맞춰 입 모양, 제스처, 신체 움직임이 동기화된 아바타 영상을 생성합니다. 여러 명의 화자가 등장하는 장면을 포함하여, 상대방과 상호작용하는 듯한 캐릭터를 구현하는 데 최적화되어 있습니다.
강점
- 단일 정지 이미지를 애니메이션화하므로, 해당 인물을 직접 촬영한 영상이 필요하지 않습니다.
- 입 모양은 제공된 오디오를 따르며, 제스처는 음성의 의미에 맞춰 선택됩니다.
- 선택 사항인 텍스트 프롬프트를 통해 오디오 외에도 동작이나 카메라 움직임을 제어할 수 있습니다.
- 두 사람의 오디오로 구동되는 장면을 지원하며, 캐릭터들이 서로 반응하는 모습을 연출할 수 있습니다.
다른 모델이 필요한 경우
- 오디오 트랙이 반드시 필요하며, 화자가 없는 일반적인 텍스트-비디오 생성 모델은 아닙니다.
- 출력 품질은 참조 이미지에 따라 달라지며, 얼굴이 잘렸거나 해상도가 낮으면 인물 식별 정확도가 떨어질 수 있습니다.
- 생성된 인물과 음성은 동의 관련 문제를 야기할 수 있으므로, 반드시 권리를 보유한 이미지와 오디오만 사용하세요.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
이미지-비디오 변환TokenLab 엔드포인트POST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
가격 책정
Official 가격은 모델 제작사의 공식 기본 가격입니다. TokenLab 가격은 TokenLab에서 이 모델을 사용할 때 지불하는 금액입니다.
이미지-비디오 변환
초당- Official 가격
- $0.1325
- Official
- $0.1325
- 할인
- —
| Official 가격초당 | Official초당 | 할인 | |
|---|---|---|---|
| 이미지-비디오 변환 | $0.1325 | $0.1325 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 OmniHuman-1.5을 열고 프롬프트를 수정하거나 전송하세요.
/v1/videos/generations에서 image-to-video을(를) 사용하여 omnihuman-1-5로 생성합니다. 결과, 상태, 비용을 확인하세요.
사용 사례
발표자 영상
인물 사진과 내레이션 트랙을 활용하여 교육, 제품 업데이트, 설명 영상용 대변인 영상을 제작하세요.
캐릭터 대화
일러스트나 사진 속 캐릭터가 대본에 맞춰 말하도록 애니메이션을 입혀 단편 소설이나 소셜 미디어용 클립을 만드세요.
현지화된 영상
하나의 발표자 이미지를 재사용하여 여러 언어로 녹음된 오디오를 입힘으로써, 각 언어에 맞는 입 모양 동기화 클립을 제작하세요.
프롬프트 예제
책상에 앉은 여성이 카메라를 보고 말하며, 차분한 제스처를 취하고 주요 지점에서 가볍게 고개를 끄덕임
공원 벤치에 앉은 두 친구가 서로 대화하며, 말하는 사람 쪽으로 몸을 돌림
가수가 작은 무대에서 공연하며, 표현력이 풍부한 손동작을 하고 카메라는 고정된 상태를 유지함
FAQ
OmniHuman-1.5는 어떤 입력을 받나요?
캐릭터 이미지 한 장, 오디오 클립, 그리고 선택적인 텍스트 프롬프트를 입력받습니다. 이미지는 인물의 정체성과 외형을 결정하고, 오디오는 입 모양 동기화와 타이밍을 주도하며, 프롬프트는 동작을 안내할 수 있습니다.
두 명 이상의 인물이 등장하는 영상을 생성할 수 있나요?
네. ByteDance는 두 명의 화자가 포함된 오디오 지원을 설명하고 있으며, 캐릭터 간의 상호작용을 하나의 클립으로 생성할 수 있고 각 인물의 움직임은 자신의 음성을 따릅니다.
OmniHuman-1.5는 아바타의 움직임을 어떻게 결정하나요?
ByteDance의 논문에 따르면, 오디오, 이미지, 프롬프트를 바탕으로 동작을 계획하는 멀티모달 언어 모델과 이를 렌더링하는 확산 트랜스포머(diffusion transformer)를 사용합니다. 이는 제스처가 단순히 반복되는 것이 아니라 콘텐츠에 자연스럽게 어우러지도록 하기 위함입니다.
일반적인 비디오 생성 모델인가요?
아니요. 오디오에 맞춰 말하거나 공연하는 인물에 특화되어 있습니다. 구동 오디오 트랙이 없는 풍경, 장면, 액션 영상 등은 일반적인 텍스트-비디오 또는 이미지-비디오 모델을 사용하세요.
OmniHuman-1.5 의 가격은 얼마인가요?
TokenLab 에서 OmniHuman-1.5 은 $0.1325 초당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
OmniHuman-1.5 은 어떤 엔드포인트를 써야 하나요?
OmniHuman-1.5에 대해 https://api.tokenlab.sh/v1/videos/generations를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
OmniHuman-1.5 은 어떤 오퍼레이션을 지원하나요?
OmniHuman-1.5은(는) 이미지-비디오 변환을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
OmniHuman-1.5 비교하기
출처
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
2026. 10. 2. 검토 완료