ByteDance: OmniHuman-1.5
omnihuman-1-5- Prix
- À partir de $0.1325
- Modalités
- Vidéo
À propos de OmniHuman-1.5
OmniHuman-1.5 est un modèle de vidéo de personne numérique du Intelligent Creation Lab de ByteDance. À partir d'une seule image d'une personne, d'un clip audio et d'un prompt textuel optionnel, il génère une vidéo d'avatar parlant ou performant avec synchronisation labiale, gestes et mouvements corporels suivant la parole. Il est conçu pour des personnages qui semblent réagir, y compris dans des scènes avec plus d'un interlocuteur.
Points forts
- Anime une seule image fixe, aucune séquence filmée de la personne n'est donc nécessaire.
- La synchronisation labiale suit l'audio fourni, et les gestes sont choisis pour correspondre au sens du discours.
- Un prompt textuel optionnel peut orienter l'action ou le comportement de la caméra en plus de l'audio.
- Prend en charge les scènes pilotées par un audio à deux personnes, avec des personnages qui réagissent l'un à l'autre.
Quand préférer un autre modèle
- Il nécessite une piste audio ; ce n'est pas un modèle général de conversion texte-vidéo pour des scènes sans locuteur.
- La qualité de sortie dépend de l'image de référence ; un visage recadré ou de faible résolution limite la fidélité de l'identité.
- Les personnes et voix générées soulèvent des questions de consentement ; utilisez uniquement des images et des audios pour lesquels vous détenez les droits.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Image vers vidéoEndpoint TokenLabPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Image vers vidéo
par seconde- Tarif Official
- $0.1325
- Official
- $0.1325
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Image vers vidéo | $0.1325 | $0.1325 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez OmniHuman-1.5 dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à créer avec omnihuman-1-5 via image-to-video sur /v1/videos/generations. Affiche le résultat, le statut et le coût.
Cas d'usage
Présentateurs parlants
Transformez un portrait et une piste de narration en une vidéo de porte-parole pour la formation, les mises à jour de produits ou les vidéos explicatives.
Dialogue de personnages
Animez des personnages illustrés ou photographiques prononçant une ligne de script pour des histoires courtes ou des clips sociaux.
Vidéo localisée
Réutilisez l'image d'un présentateur avec un audio enregistré en plusieurs langues, en produisant un clip avec synchronisation labiale correspondant pour chacune.
Exemples de prompts
Une femme à un bureau parle à la caméra, gestes calmes, hoche légèrement la tête aux moments clés
Deux amis sur un banc de parc se parlent, se tournant vers la personne qui parle
Le chanteur se produit sur une petite scène, mouvements de mains expressifs, la caméra reste stable
FAQ
Quelles entrées OmniHuman-1.5 accepte-t-il ?
Une seule image du personnage, un clip audio et, optionnellement, un prompt textuel. L'image définit l'identité et l'apparence, l'audio pilote la synchronisation labiale et le timing, et le prompt peut guider l'action.
Peut-il générer des vidéos avec plus d'une personne ?
Oui. ByteDance décrit la prise en charge de l'audio avec deux locuteurs, permettant de générer l'interaction entre les personnages dans un seul clip, chaque mouvement suivant le discours de la personne concernée.
Comment OmniHuman-1.5 décide-t-il des mouvements de l'avatar ?
L'article de ByteDance décrit un modèle de langage multimodal qui planifie l'action à partir de l'audio, de l'image et du prompt, ainsi qu'un transformeur de diffusion qui rend le mouvement. Cela vise à faire en sorte que les gestes correspondent au contenu plutôt que de boucler de manière générique.
Est-ce un générateur vidéo généraliste ?
Non. Il est spécialisé pour les personnes qui parlent ou jouent sur un audio. Pour des scènes, des paysages ou des séquences d'action sans piste audio directrice, utilisez un modèle général de conversion texte-vidéo ou image-vidéo.
Combien coûte OmniHuman-1.5 ?
Sur TokenLab, OmniHuman-1.5 coûte $0.1325 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint OmniHuman-1.5 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/videos/generations pour OmniHuman-1.5. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations OmniHuman-1.5 prend-il en charge ?
OmniHuman-1.5 prend en charge Image vers vidéo. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer OmniHuman-1.5
Sources
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
Mis à jour le 2 oct. 2026