ByteDance: OmniHuman-1.5
omnihuman-1-5- Preço
- A partir de $0.1325
- Modalidades
- Vídeo
Sobre o OmniHuman-1.5
O OmniHuman-1.5 é um modelo de vídeo de humano digital do Intelligent Creation Lab da ByteDance. A partir de uma imagem de uma pessoa, um clipe de áudio e um prompt de texto opcional, ele gera um vídeo de avatar falando ou atuando, com sincronia labial, gestos e movimentos corporais que acompanham a fala. Ele foi criado para personagens que parecem estar reagindo, incluindo cenas com mais de um falante.
Pontos fortes
- Anima uma única imagem estática, portanto, não é necessária filmagem da pessoa.
- A sincronia labial segue o áudio fornecido, e os gestos são escolhidos para combinar com o significado da fala.
- Um prompt de texto opcional pode direcionar a ação ou o comportamento da câmera além do áudio.
- Suporta cenas conduzidas por áudio de duas pessoas, com os personagens reagindo um ao outro.
Quando usar outro modelo
- Ele precisa de uma trilha de áudio; não é um modelo geral de texto para vídeo para cenas sem um falante.
- A qualidade da saída depende da imagem de referência, e um rosto cortado ou de baixa resolução limita a fidelidade da identidade.
- Pessoas e vozes geradas levantam questões de consentimento, portanto, use apenas imagens e áudios sobre os quais você tenha direitos.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Imagem para vídeoEndpoint do TokenLabPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Imagem para vídeo
por segundo- Preço oficial
- $0.1325
- Official
- $0.1325
- Desconto
- —
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Imagem para vídeo | $0.1325 | $0.1325 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra OmniHuman-1.5 no Console com um prompt pronto para editar ou enviar.
Ajude-me a criar com omnihuman-1-5 usando image-to-video em /v1/videos/generations. Exiba o resultado, status e custo.
Casos de uso
Apresentadores falantes
Transforme um retrato e uma trilha de narração em um vídeo de porta-voz para treinamentos, atualizações de produtos ou vídeos explicativos.
Diálogo de personagens
Anime personagens ilustrados ou fotográficos falando uma linha roteirizada para histórias curtas e clipes sociais.
Vídeo localizado
Reutilize uma imagem de apresentador com áudio gravado em vários idiomas, produzindo um clipe com sincronia labial correspondente para cada um.
Exemplos de prompt
Uma mulher em uma mesa fala para a câmera, gestos calmos, acena levemente em pontos-chave
Dois amigos em um banco de parque conversam entre si, virando-se para a pessoa que está falando
O cantor se apresenta em um pequeno palco, movimentos expressivos das mãos, câmera permanece estável
FAQ
Quais entradas o OmniHuman-1.5 aceita?
Uma única imagem do personagem, um clipe de áudio e, opcionalmente, um prompt de texto. A imagem define a identidade e a aparência, o áudio conduz a sincronia labial e o tempo, e o prompt pode guiar a ação.
Ele pode gerar vídeos com mais de uma pessoa?
Sim. A ByteDance descreve suporte para áudio com dois falantes, permitindo que a interação entre personagens seja gerada em um único clipe, e o movimento de cada pessoa segue sua própria fala.
Como o OmniHuman-1.5 decide como o avatar se move?
O artigo da ByteDance descreve um modelo de linguagem multimodal que planeja a ação a partir do áudio, da imagem e do prompt, e um transformador de difusão que renderiza o movimento. Isso visa fazer com que os gestos se ajustem ao conteúdo, em vez de serem repetidos genericamente.
Ele é um gerador de vídeo geral?
Não. Ele é especializado em pessoas que falam ou atuam com áudio. Para cenas, paisagens ou filmagens de ação sem uma trilha de áudio condutora, use um modelo geral de texto para vídeo ou imagem para vídeo.
Quanto custa o OmniHuman-1.5?
No TokenLab, OmniHuman-1.5 custa $0.1325 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o OmniHuman-1.5 deve usar?
Use https://api.tokenlab.sh/v1/videos/generations para OmniHuman-1.5. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o OmniHuman-1.5 suporta?
OmniHuman-1.5 suporta Imagem para vídeo. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar OmniHuman-1.5
Fontes
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
Revisado em 2 de out. de 2026