Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

ByteDance: OmniHuman-1.5

Harga, performa, kapabilitas, dan permintaan siap pakai untuk OmniHuman-1.5.
Bandingkan model
omnihuman-1-5
TersediaByteDanceBuat videoAsinkron
Harga
Mulai dari $0.1325
Modalitas
Buat video

Tentang OmniHuman-1.5

OmniHuman-1.5 adalah model video manusia digital dari Intelligent Creation Lab milik ByteDance. Dari satu gambar seseorang, klip audio, dan prompt teks opsional, model ini menghasilkan video avatar yang berbicara atau melakukan pertunjukan dengan sinkronisasi bibir, gestur, dan gerakan tubuh yang mengikuti ucapan. Model ini dibuat untuk karakter yang terlihat seperti sedang bereaksi, termasuk adegan dengan lebih dari satu pembicara.

Kelebihan

  • Menganimasikan satu gambar diam, sehingga tidak diperlukan rekaman video orang tersebut.
  • Sinkronisasi bibir mengikuti audio yang disediakan, dan gestur dipilih agar sesuai dengan makna ucapan.
  • Prompt teks opsional dapat mengarahkan tindakan atau perilaku kamera di atas audio.
  • Mendukung adegan yang digerakkan oleh audio dua orang, dengan karakter yang bereaksi satu sama lain.

Kapan harus beralih

  • Model ini memerlukan trek audio; ini bukan model teks-ke-video umum untuk adegan tanpa pembicara.
  • Kualitas output bergantung pada gambar referensi, dan wajah yang terpotong atau beresolusi rendah membatasi fidelitas identitas.
  • Orang dan suara yang dihasilkan menimbulkan pertanyaan tentang persetujuan, jadi gunakan hanya gambar dan audio yang haknya Anda miliki.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Gambar ke videoEndpoint TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Gambar ke video

per detik
Harga Official
$0.1325
Official
$0.1325
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka OmniHuman-1.5 di Console dengan prompt siap diedit atau dikirim.

Bantu saya berkreasi dengan omnihuman-1-5 menggunakan image-to-video di /v1/videos/generations. Tampilkan hasil, status, dan biayanya.

Skenario penggunaan

  • Presenter yang berbicara

    Ubah potret dan trek narasi menjadi video juru bicara untuk pelatihan, pembaruan produk, atau penjelasan.

  • Dialog karakter

    Animasikan karakter ilustrasi atau foto yang mengucapkan baris naskah untuk cerita pendek dan klip sosial.

  • Video yang dilokalisasi

    Gunakan kembali satu gambar presenter dengan audio yang direkam dalam beberapa bahasa, menghasilkan klip sinkronisasi bibir yang cocok untuk masing-masing bahasa.

Contoh prompt

Seorang wanita di meja berbicara ke kamera, gestur tenang, sedikit mengangguk pada poin-poin penting

Dua teman di bangku taman berbicara satu sama lain, menoleh ke arah orang yang berbicara

Penyanyi tampil di panggung kecil, gerakan tangan ekspresif, kamera tetap stabil

FAQ

Input apa saja yang diterima OmniHuman-1.5?

Satu gambar karakter, klip audio, dan secara opsional, prompt teks. Gambar menetapkan identitas dan penampilan, audio menggerakkan sinkronisasi bibir dan waktu, dan prompt dapat memandu tindakan.

Bisakah model ini menghasilkan video dengan lebih dari satu orang?

Ya. ByteDance menjelaskan dukungan untuk audio dengan dua pembicara, sehingga interaksi antar karakter dapat dihasilkan dalam satu klip, dan gerakan setiap orang mengikuti ucapan mereka sendiri.

Bagaimana OmniHuman-1.5 menentukan cara avatar bergerak?

Makalah ByteDance menjelaskan model bahasa multimodal yang merencanakan tindakan dari audio, gambar, dan prompt, serta diffusion transformer yang merender gerakan. Hal ini dimaksudkan agar gestur sesuai dengan konten daripada berulang secara generik.

Apakah ini generator video umum?

Tidak. Model ini dikhususkan untuk orang yang berbicara atau tampil mengikuti audio. Untuk adegan, lanskap, atau rekaman aksi tanpa trek audio penggerak, gunakan model teks-ke-video atau gambar-ke-video umum.

Berapa biaya OmniHuman-1.5?

Di TokenLab, OmniHuman-1.5 dikenakan $0.1325 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Endpoint mana yang harus digunakan OmniHuman-1.5?

Pakai https://api.tokenlab.sh/v1/videos/generations sebagai default untuk OmniHuman-1.5. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung OmniHuman-1.5?

OmniHuman-1.5 mendukung Gambar ke video. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan OmniHuman-1.5

Sumber

Ditinjau 2 Okt 2026

Model terkait