Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

ByteDance: OmniHuman-1.5

Precio, rendimiento, capacidades y una solicitud lista para usar con OmniHuman-1.5.
Comparar modelos
omnihuman-1-5
DisponibleByteDanceGenerar videoAsíncrono
Precio
Desde $0.1325
Modalidades
Generar video

Sobre OmniHuman-1.5

OmniHuman-1.5 es un modelo de video de humanos digitales del Intelligent Creation Lab de ByteDance. A partir de una imagen de una persona, un clip de audio y un prompt de texto opcional, genera un video de un avatar hablando o actuando con sincronización labial, gestos y movimiento corporal que siguen al discurso. Está diseñado para personajes que parecen reaccionar, incluyendo escenas con más de un hablante.

Puntos fuertes

  • Anima una sola imagen fija, por lo que no se necesita metraje filmado de la persona.
  • La sincronización labial sigue el audio suministrado y los gestos se eligen para que coincidan con el significado del discurso.
  • Un prompt de texto opcional puede dirigir la acción o el comportamiento de la cámara además del audio.
  • Admite escenas impulsadas por audio de dos personas, con los personajes reaccionando entre sí.

Cuándo buscar otra opción

  • Necesita una pista de audio; no es un modelo general de texto a video para escenas sin un hablante.
  • La calidad de la salida depende de la imagen de referencia, y una cara recortada o de baja resolución limita la fidelidad de la identidad.
  • Las personas y voces generadas plantean cuestiones de consentimiento, así que utilice solo imágenes y audios sobre los que tenga derechos.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Imagen a videoEndpoint de TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Imagen a video

por segundo
Precio Official
$0.1325
Official
$0.1325
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre OmniHuman-1.5 en Console con un prompt listo para editar o enviar.

Ayúdame a crear con omnihuman-1-5 usando image-to-video en /v1/videos/generations. Muestra el resultado, el estado y el coste.

Casos de uso

  • Presentadores que hablan

    Convierta un retrato y una pista de narración en un video de portavoz para capacitación, actualizaciones de productos o videos explicativos.

  • Diálogo de personajes

    Anime personajes ilustrados o fotográficos diciendo una línea de guion para historias cortas y clips sociales.

  • Video localizado

    Reutilice una imagen de presentador con audio grabado en varios idiomas, produciendo un clip con sincronización labial coincidente para cada uno.

Ejemplos de prompts

Una mujer en un escritorio habla a la cámara, gestos tranquilos, asiente ligeramente en puntos clave

Dos amigos en un banco del parque hablan entre sí, girándose hacia la persona que habla

El cantante actúa en un escenario pequeño, movimientos de manos expresivos, la cámara permanece estable

FAQ

¿Qué entradas acepta OmniHuman-1.5?

Una sola imagen del personaje, un clip de audio y, opcionalmente, un prompt de texto. La imagen establece la identidad y la apariencia, el audio impulsa la sincronización labial y el tiempo, y el prompt puede guiar la acción.

¿Puede generar videos con más de una persona?

Sí. ByteDance describe soporte para audio con dos hablantes, por lo que la interacción entre personajes puede generarse en un solo clip, y el movimiento de cada persona sigue su propio discurso.

¿Cómo decide OmniHuman-1.5 cómo se mueve el avatar?

El documento de ByteDance describe un modelo de lenguaje multimodal que planifica la acción a partir del audio, la imagen y el prompt, y un transformador de difusión que renderiza el movimiento. Esto tiene como objetivo hacer que los gestos se ajusten al contenido en lugar de repetirse genéricamente.

¿Es un generador de video general?

No. Está especializado en personas que hablan o actúan con audio. Para escenas, paisajes o metraje de acción sin una pista de audio conductora, utilice un modelo general de texto a video o imagen a video.

¿Cuánto cuesta OmniHuman-1.5?

En TokenLab, OmniHuman-1.5 cuesta $0.1325 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar OmniHuman-1.5?

Utiliza https://api.tokenlab.sh/v1/videos/generations para OmniHuman-1.5. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta OmniHuman-1.5?

OmniHuman-1.5 admite Imagen a video. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar OmniHuman-1.5

Fuentes

Revisado el 2 oct 2026

Modelos relacionados