ByteDance: OmniHuman-1.5
omnihuman-1-5- السعر
- ابتداءً من $0.1325
- الأنماط
- فيديو
عن OmniHuman-1.5
OmniHuman-1.5 هو نموذج فيديو رقمي بشري من مختبر Intelligent Creation التابع لشركة ByteDance. من صورة واحدة لشخص، ومقطع صوتي، ومطالبة نصية اختيارية، يقوم النموذج بإنشاء فيديو لشخصية تتحدث أو تؤدي حركات مع مزامنة الشفاه، والإيماءات، وحركة الجسم التي تتبع الكلام. صُمم النموذج للشخصيات التي تبدو وكأنها تتفاعل، بما في ذلك المشاهد التي تضم أكثر من متحدث.
نقاط القوة
- يقوم بتحريك صورة ثابتة واحدة، لذا لا حاجة لتصوير لقطات فيديو للشخص.
- تتبع مزامنة الشفاه الصوت المقدم، ويتم اختيار الإيماءات لتتناسب مع معنى الكلام.
- يمكن لمطالبة نصية اختيارية توجيه الحركة أو سلوك الكاميرا بالإضافة إلى الصوت.
- يدعم المشاهد التي تعتمد على صوت شخصين، مع تفاعل الشخصيات مع بعضها البعض.
متى تستخدم نموذجاً آخر
- يحتاج النموذج إلى مسار صوتي؛ فهو ليس نموذجاً عاماً لتحويل النص إلى فيديو للمشاهد التي لا تحتوي على متحدث.
- تعتمد جودة المخرجات على الصورة المرجعية، كما أن الوجه المقصوص أو منخفض الدقة يحد من دقة الهوية.
- تثير الأشخاص والأصوات المولدة أسئلة حول الموافقة، لذا استخدم فقط الصور والأصوات التي تمتلك حقوقها.
البدء
إنشاء مفتاح API
أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.
إرسال طلبك الأول
انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).
صورة إلى فيديونقطة اتصال TokenLabPOST/v1/videos/generationscurl -X POST "https://api.tokenlab.sh/v1/videos/generations" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "image-to-video", "model": "omnihuman-1-5", "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.", "image_url": "https://example.com/image.jpg" }'
التسعير
السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.
صورة إلى فيديو
لكل ثانية- السعر الرسمي
- $0.1325
- Official
- $0.1325
- خصم
- —
| السعر الرسميلكل ثانية | Officialلكل ثانية | خصم | |
|---|---|---|---|
| صورة إلى فيديو | $0.1325 | $0.1325 | — |
الاستخدام والنشاط
معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.
الاستخدام والتوفر
آخر 24 ساعة- الطلبات
- معدل النجاح
- زمن الاستجابة P95
- إجمالي الرموز
تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.
فتح في Console
افتح OmniHuman-1.5 في Console وجهز الرسالة للتعديل أو الإرسال.
ساعدني في الإنشاء باستخدام omnihuman-1-5 عبر image-to-video في /v1/videos/generations. اعرض النتيجة والحالة والتكلفة.
حالات الاستخدام
مقدمو العروض المتحدثون
حول صورة شخصية ومسار سردي إلى فيديو لمتحدث رسمي للتدريب، أو تحديثات المنتجات، أو الشروحات.
حوار الشخصيات
حرك شخصيات مصورة أو فوتوغرافية وهي تنطق سطراً مكتوباً للقصص القصيرة ومقاطع التواصل الاجتماعي.
فيديو مترجم محلياً
أعد استخدام صورة مقدم عرض واحد مع صوت مسجل بعدة لغات، لإنتاج مقطع متوافق مع مزامنة الشفاه لكل لغة.
أمثلة Prompt
امرأة على مكتب تتحدث إلى الكاميرا، إيماءات هادئة، تومئ برأسها قليلاً في نقاط رئيسية
صديقان على مقعد في حديقة يتحدثان إلى بعضهما البعض، يلتفتان نحو الشخص الذي يتحدث
المغني يؤدي على مسرح صغير، حركات يد تعبيرية، الكاميرا تظل ثابتة
FAQ
ما هي المدخلات التي يقبلها OmniHuman-1.5؟
صورة واحدة للشخصية، ومقطع صوتي، ومطالبة نصية اختيارية. تحدد الصورة الهوية والمظهر، ويقود الصوت مزامنة الشفاه والتوقيت، ويمكن للمطالبة توجيه الحركة.
هل يمكنه إنشاء مقاطع فيديو تضم أكثر من شخص؟
نعم. تصف ByteDance دعم الصوت بمتحدثين اثنين، بحيث يمكن إنشاء التفاعل بين الشخصيات في مقطع واحد، وتتبع حركة كل شخص كلامه الخاص.
كيف يقرر OmniHuman-1.5 كيفية تحرك الشخصية الرمزية (الأفاتار)؟
تصف ورقة ByteDance نموذج لغة متعدد الوسائط يخطط للحركة بناءً على الصوت والصورة والمطالبة، ومحول انتشار (diffusion transformer) يقوم بتجسيد الحركة. يهدف ذلك إلى جعل الإيماءات تتناسب مع المحتوى بدلاً من تكرارها بشكل عام.
هل هو مولد فيديو عام؟
لا. هو متخصص للأشخاص الذين يتحدثون أو يؤدون بناءً على صوت. بالنسبة للمشاهد، أو المناظر الطبيعية، أو لقطات الحركة بدون مسار صوتي توجيهي، استخدم نموذجاً عاماً لتحويل النص إلى فيديو أو الصورة إلى فيديو.
كم تكلفة OmniHuman-1.5؟
على TokenLab تكلف OmniHuman-1.5 $0.1325 لكل ثانية. التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.
ما نقطة النهاية التي يجب أن يستخدمها OmniHuman-1.5؟
استخدم https://api.tokenlab.sh/v1/videos/generations كافتراضي لـ OmniHuman-1.5. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.
ما العمليات التي يدعمها OmniHuman-1.5؟
OmniHuman-1.5 يدعم صورة إلى فيديو. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.
مقارنة OmniHuman-1.5
المصادر
- OmniHuman-1.5 project page
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv)
تمت المراجعة في ٠٢/١٠/٢٠٢٦