Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

ByteDance: OmniHuman-1.5

Preis, Leistung, Fähigkeiten und eine sofort einsatzbereite Anfrage für OmniHuman-1.5.
Modelle vergleichen
omnihuman-1-5
VerfügbarByteDanceVideo erzeugenAsynchron
Preis
Ab $0.1325
Modalitäten
Video erzeugen

Über OmniHuman-1.5

OmniHuman-1.5 ist ein Digital-Human-Video-Modell des Intelligent Creation Lab von ByteDance. Aus einem einzigen Bild einer Person, einem Audioclip und einem optionalen Text-Prompt generiert es ein Video eines sprechenden oder agierenden Avatars mit Lippensynchronisation, Gestik und Körperbewegungen, die der Sprache folgen. Es ist für Charaktere konzipiert, die lebendig wirken, einschließlich Szenen mit mehr als einem Sprecher.

Stärken

  • Animiert ein einzelnes Standbild, sodass kein gefilmtes Material der Person erforderlich ist.
  • Die Lippensynchronisation folgt dem bereitgestellten Audio, und die Gestik wird passend zur Bedeutung der Sprache gewählt.
  • Ein optionaler Text-Prompt kann zusätzlich zum Audio die Aktion oder das Kameraverhalten steuern.
  • Unterstützt Szenen mit zwei Sprechern, bei denen die Charaktere aufeinander reagieren.

Alternativen

  • Es benötigt eine Audiospur; es ist kein allgemeines Text-zu-Video-Modell für Szenen ohne Sprecher.
  • Die Ausgabequalität hängt vom Referenzbild ab; ein zugeschnittenes oder niedrig aufgelöstes Gesicht schränkt die Identitätstreue ein.
  • Generierte Personen und Stimmen werfen Fragen zum Einverständnis auf; verwenden Sie daher nur Bilder und Audios, an denen Sie die Rechte besitzen.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Bild zu VideoTokenLab-Endpunkt
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Bild zu Video

pro Sekunde
Offizieller Preis
$0.1325
Official
$0.1325
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne OmniHuman-1.5 in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Erstelle mit omnihuman-1-5 über image-to-video an /v1/videos/generations. Zeige Ergebnis, Status und Kosten.

Anwendungsfälle

  • Sprechende Moderatoren

    Verwandeln Sie ein Porträt und eine Erzählspur in ein Sprechervideo für Schulungen, Produkt-Updates oder Erklärvideos.

  • Charakter-Dialoge

    Animieren Sie illustrierte oder fotografische Charaktere, die eine skriptbasierte Zeile für Kurzgeschichten oder Social-Media-Clips sprechen.

  • Lokalisierte Videos

    Verwenden Sie ein Moderatorenbild mit Audioaufnahmen in verschiedenen Sprachen wieder, um für jede Sprache einen passenden lippensynchronen Clip zu erstellen.

Prompt-Beispiele

Eine Frau am Schreibtisch spricht in die Kamera, ruhige Gestik, nickt leicht an wichtigen Stellen.

Zwei Freunde auf einer Parkbank unterhalten sich und drehen sich zu der Person, die gerade spricht.

Der Sänger tritt auf einer kleinen Bühne auf, ausdrucksstarke Handbewegungen, die Kamera bleibt ruhig.

FAQ

Welche Eingaben verarbeitet OmniHuman-1.5?

Ein einzelnes Bild des Charakters, einen Audioclip und optional einen Text-Prompt. Das Bild bestimmt Identität und Aussehen, das Audio steuert Lippensynchronisation und Timing, und der Prompt kann die Aktion lenken.

Kann es Videos mit mehr als einer Person generieren?

Ja. ByteDance beschreibt die Unterstützung für Audio mit zwei Sprechern, sodass die Interaktion zwischen Charakteren in einem Clip generiert werden kann und die Bewegung jeder Person ihrer eigenen Sprache folgt.

Wie entscheidet OmniHuman-1.5, wie sich der Avatar bewegt?

Das Paper von ByteDance beschreibt ein multimodales Sprachmodell, das die Aktion aus Audio, Bild und Prompt plant, sowie einen Diffusion-Transformer, der die Bewegung rendert. Dies soll sicherstellen, dass die Gestik zum Inhalt passt, anstatt generische Schleifen zu verwenden.

Ist es ein allgemeiner Videogenerator?

Nein. Es ist auf Personen spezialisiert, die sprechen oder zu Audio agieren. Für Szenen, Landschaften oder Action-Aufnahmen ohne begleitende Audiospur verwenden Sie ein allgemeines Text-zu-Video- oder Bild-zu-Video-Modell.

Was kostet OmniHuman-1.5?

Auf TokenLab kostet OmniHuman-1.5 $0.1325 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll OmniHuman-1.5 verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/videos/generations für OmniHuman-1.5. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt OmniHuman-1.5?

OmniHuman-1.5 unterstützt Bild zu Video. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

OmniHuman-1.5 vergleichen

Quellen

Geprüft am 02.10.2026

Ähnliche Modelle