Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

ByteDance: OmniHuman-1.5

Prix, performances, capacités et requête prête à l'emploi pour OmniHuman-1.5.
Comparer les modèles
omnihuman-1-5
DisponibleByteDanceVidéoAsynchrone
Prix
À partir de $0.1325
Modalités
Vidéo

À propos de OmniHuman-1.5

OmniHuman-1.5 est un modèle de vidéo de personne numérique du Intelligent Creation Lab de ByteDance. À partir d'une seule image d'une personne, d'un clip audio et d'un prompt textuel optionnel, il génère une vidéo d'avatar parlant ou performant avec synchronisation labiale, gestes et mouvements corporels suivant la parole. Il est conçu pour des personnages qui semblent réagir, y compris dans des scènes avec plus d'un interlocuteur.

Points forts

  • Anime une seule image fixe, aucune séquence filmée de la personne n'est donc nécessaire.
  • La synchronisation labiale suit l'audio fourni, et les gestes sont choisis pour correspondre au sens du discours.
  • Un prompt textuel optionnel peut orienter l'action ou le comportement de la caméra en plus de l'audio.
  • Prend en charge les scènes pilotées par un audio à deux personnes, avec des personnages qui réagissent l'un à l'autre.

Quand préférer un autre modèle

  • Il nécessite une piste audio ; ce n'est pas un modèle général de conversion texte-vidéo pour des scènes sans locuteur.
  • La qualité de sortie dépend de l'image de référence ; un visage recadré ou de faible résolution limite la fidélité de l'identité.
  • Les personnes et voix générées soulèvent des questions de consentement ; utilisez uniquement des images et des audios pour lesquels vous détenez les droits.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Image vers vidéoEndpoint TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Image vers vidéo

par seconde
Tarif Official
$0.1325
Official
$0.1325
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez OmniHuman-1.5 dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à créer avec omnihuman-1-5 via image-to-video sur /v1/videos/generations. Affiche le résultat, le statut et le coût.

Cas d'usage

  • Présentateurs parlants

    Transformez un portrait et une piste de narration en une vidéo de porte-parole pour la formation, les mises à jour de produits ou les vidéos explicatives.

  • Dialogue de personnages

    Animez des personnages illustrés ou photographiques prononçant une ligne de script pour des histoires courtes ou des clips sociaux.

  • Vidéo localisée

    Réutilisez l'image d'un présentateur avec un audio enregistré en plusieurs langues, en produisant un clip avec synchronisation labiale correspondant pour chacune.

Exemples de prompts

Une femme à un bureau parle à la caméra, gestes calmes, hoche légèrement la tête aux moments clés

Deux amis sur un banc de parc se parlent, se tournant vers la personne qui parle

Le chanteur se produit sur une petite scène, mouvements de mains expressifs, la caméra reste stable

FAQ

Quelles entrées OmniHuman-1.5 accepte-t-il ?

Une seule image du personnage, un clip audio et, optionnellement, un prompt textuel. L'image définit l'identité et l'apparence, l'audio pilote la synchronisation labiale et le timing, et le prompt peut guider l'action.

Peut-il générer des vidéos avec plus d'une personne ?

Oui. ByteDance décrit la prise en charge de l'audio avec deux locuteurs, permettant de générer l'interaction entre les personnages dans un seul clip, chaque mouvement suivant le discours de la personne concernée.

Comment OmniHuman-1.5 décide-t-il des mouvements de l'avatar ?

L'article de ByteDance décrit un modèle de langage multimodal qui planifie l'action à partir de l'audio, de l'image et du prompt, ainsi qu'un transformeur de diffusion qui rend le mouvement. Cela vise à faire en sorte que les gestes correspondent au contenu plutôt que de boucler de manière générique.

Est-ce un générateur vidéo généraliste ?

Non. Il est spécialisé pour les personnes qui parlent ou jouent sur un audio. Pour des scènes, des paysages ou des séquences d'action sans piste audio directrice, utilisez un modèle général de conversion texte-vidéo ou image-vidéo.

Combien coûte OmniHuman-1.5 ?

Sur TokenLab, OmniHuman-1.5 coûte $0.1325 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint OmniHuman-1.5 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/videos/generations pour OmniHuman-1.5. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations OmniHuman-1.5 prend-il en charge ?

OmniHuman-1.5 prend en charge Image vers vidéo. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer OmniHuman-1.5

Sources

Mis à jour le 2 oct. 2026

Modèles associés