ByteDance: OmniHuman-1.5
omnihuman-1-5- Harga
- Mulai dari $0.1325
- Modalitas
- Buat video
Tentang OmniHuman-1.5
OmniHuman-1.5 adalah model video manusia digital dari Intelligent Creation Lab milik ByteDance. Dari satu gambar seseorang, klip audio, dan prompt teks opsional, model ini menghasilkan video avatar yang berbicara atau melakukan pertunjukan dengan sinkronisasi bibir, gestur, dan gerakan tubuh yang mengikuti ucapan. Model ini dibuat untuk karakter yang terlihat seperti sedang bereaksi, termasuk adegan dengan lebih dari satu pembicara.
Kelebihan
- Menganimasikan satu gambar diam, sehingga tidak diperlukan rekaman video orang tersebut.
- Sinkronisasi bibir mengikuti audio yang disediakan, dan gestur dipilih agar sesuai dengan makna ucapan.
- Prompt teks opsional dapat mengarahkan tindakan atau perilaku kamera di atas audio.
- Mendukung adegan yang digerakkan oleh audio dua orang, dengan karakter yang bereaksi satu sama lain.
Kapan harus beralih
- Model ini memerlukan trek audio; ini bukan model teks-ke-video umum untuk adegan tanpa pembicara.
- Kualitas output bergantung pada gambar referensi, dan wajah yang terpotong atau beresolusi rendah membatasi fidelitas identitas.
- Orang dan suara yang dihasilkan menimbulkan pertanyaan tentang persetujuan, jadi gunakan hanya gambar dan audio yang haknya Anda miliki.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Gambar ke videoEndpoint TokenLabPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Gambar ke video
per detik- Harga Official
- $0.1325
- Official
- $0.1325
- Diskon
- —
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Gambar ke video | $0.1325 | $0.1325 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka OmniHuman-1.5 di Console dengan prompt siap diedit atau dikirim.
Bantu saya berkreasi dengan omnihuman-1-5 menggunakan image-to-video di /v1/videos/generations. Tampilkan hasil, status, dan biayanya.
Skenario penggunaan
Presenter yang berbicara
Ubah potret dan trek narasi menjadi video juru bicara untuk pelatihan, pembaruan produk, atau penjelasan.
Dialog karakter
Animasikan karakter ilustrasi atau foto yang mengucapkan baris naskah untuk cerita pendek dan klip sosial.
Video yang dilokalisasi
Gunakan kembali satu gambar presenter dengan audio yang direkam dalam beberapa bahasa, menghasilkan klip sinkronisasi bibir yang cocok untuk masing-masing bahasa.
Contoh prompt
Seorang wanita di meja berbicara ke kamera, gestur tenang, sedikit mengangguk pada poin-poin penting
Dua teman di bangku taman berbicara satu sama lain, menoleh ke arah orang yang berbicara
Penyanyi tampil di panggung kecil, gerakan tangan ekspresif, kamera tetap stabil
FAQ
Input apa saja yang diterima OmniHuman-1.5?
Satu gambar karakter, klip audio, dan secara opsional, prompt teks. Gambar menetapkan identitas dan penampilan, audio menggerakkan sinkronisasi bibir dan waktu, dan prompt dapat memandu tindakan.
Bisakah model ini menghasilkan video dengan lebih dari satu orang?
Ya. ByteDance menjelaskan dukungan untuk audio dengan dua pembicara, sehingga interaksi antar karakter dapat dihasilkan dalam satu klip, dan gerakan setiap orang mengikuti ucapan mereka sendiri.
Bagaimana OmniHuman-1.5 menentukan cara avatar bergerak?
Makalah ByteDance menjelaskan model bahasa multimodal yang merencanakan tindakan dari audio, gambar, dan prompt, serta diffusion transformer yang merender gerakan. Hal ini dimaksudkan agar gestur sesuai dengan konten daripada berulang secara generik.
Apakah ini generator video umum?
Tidak. Model ini dikhususkan untuk orang yang berbicara atau tampil mengikuti audio. Untuk adegan, lanskap, atau rekaman aksi tanpa trek audio penggerak, gunakan model teks-ke-video atau gambar-ke-video umum.
Berapa biaya OmniHuman-1.5?
Di TokenLab, OmniHuman-1.5 dikenakan $0.1325 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan OmniHuman-1.5?
Pakai https://api.tokenlab.sh/v1/videos/generations sebagai default untuk OmniHuman-1.5. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung OmniHuman-1.5?
OmniHuman-1.5 mendukung Gambar ke video. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan OmniHuman-1.5
Sumber
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
Ditinjau 2 Okt 2026