Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

ByteDance: OmniHuman-1.5

Preço, desempenho, capacidades e uma solicitação pronta para usar com OmniHuman-1.5.
Comparar modelos
omnihuman-1-5
DisponívelByteDanceVídeoAssíncrono
Preço
A partir de $0.1325
Modalidades
Vídeo

Sobre o OmniHuman-1.5

O OmniHuman-1.5 é um modelo de vídeo de humano digital do Intelligent Creation Lab da ByteDance. A partir de uma imagem de uma pessoa, um clipe de áudio e um prompt de texto opcional, ele gera um vídeo de avatar falando ou atuando, com sincronia labial, gestos e movimentos corporais que acompanham a fala. Ele foi criado para personagens que parecem estar reagindo, incluindo cenas com mais de um falante.

Pontos fortes

  • Anima uma única imagem estática, portanto, não é necessária filmagem da pessoa.
  • A sincronia labial segue o áudio fornecido, e os gestos são escolhidos para combinar com o significado da fala.
  • Um prompt de texto opcional pode direcionar a ação ou o comportamento da câmera além do áudio.
  • Suporta cenas conduzidas por áudio de duas pessoas, com os personagens reagindo um ao outro.

Quando usar outro modelo

  • Ele precisa de uma trilha de áudio; não é um modelo geral de texto para vídeo para cenas sem um falante.
  • A qualidade da saída depende da imagem de referência, e um rosto cortado ou de baixa resolução limita a fidelidade da identidade.
  • Pessoas e vozes geradas levantam questões de consentimento, portanto, use apenas imagens e áudios sobre os quais você tenha direitos.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Imagem para vídeoEndpoint do TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Imagem para vídeo

por segundo
Preço oficial
$0.1325
Official
$0.1325
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra OmniHuman-1.5 no Console com um prompt pronto para editar ou enviar.

Ajude-me a criar com omnihuman-1-5 usando image-to-video em /v1/videos/generations. Exiba o resultado, status e custo.

Casos de uso

  • Apresentadores falantes

    Transforme um retrato e uma trilha de narração em um vídeo de porta-voz para treinamentos, atualizações de produtos ou vídeos explicativos.

  • Diálogo de personagens

    Anime personagens ilustrados ou fotográficos falando uma linha roteirizada para histórias curtas e clipes sociais.

  • Vídeo localizado

    Reutilize uma imagem de apresentador com áudio gravado em vários idiomas, produzindo um clipe com sincronia labial correspondente para cada um.

Exemplos de prompt

Uma mulher em uma mesa fala para a câmera, gestos calmos, acena levemente em pontos-chave

Dois amigos em um banco de parque conversam entre si, virando-se para a pessoa que está falando

O cantor se apresenta em um pequeno palco, movimentos expressivos das mãos, câmera permanece estável

FAQ

Quais entradas o OmniHuman-1.5 aceita?

Uma única imagem do personagem, um clipe de áudio e, opcionalmente, um prompt de texto. A imagem define a identidade e a aparência, o áudio conduz a sincronia labial e o tempo, e o prompt pode guiar a ação.

Ele pode gerar vídeos com mais de uma pessoa?

Sim. A ByteDance descreve suporte para áudio com dois falantes, permitindo que a interação entre personagens seja gerada em um único clipe, e o movimento de cada pessoa segue sua própria fala.

Como o OmniHuman-1.5 decide como o avatar se move?

O artigo da ByteDance descreve um modelo de linguagem multimodal que planeja a ação a partir do áudio, da imagem e do prompt, e um transformador de difusão que renderiza o movimento. Isso visa fazer com que os gestos se ajustem ao conteúdo, em vez de serem repetidos genericamente.

Ele é um gerador de vídeo geral?

Não. Ele é especializado em pessoas que falam ou atuam com áudio. Para cenas, paisagens ou filmagens de ação sem uma trilha de áudio condutora, use um modelo geral de texto para vídeo ou imagem para vídeo.

Quanto custa o OmniHuman-1.5?

No TokenLab, OmniHuman-1.5 custa $0.1325 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o OmniHuman-1.5 deve usar?

Use https://api.tokenlab.sh/v1/videos/generations para OmniHuman-1.5. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o OmniHuman-1.5 suporta?

OmniHuman-1.5 suporta Imagem para vídeo. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar OmniHuman-1.5

Fontes

Revisado em 2 de out. de 2026

Modelos relacionados