اختر Auto أو TokenLab Verified أو Official لكل طلب، مع عرض الأسعار مسبقاً.اطلع على الجديد

ByteDance: OmniHuman-1.5

السعر، والأداء، والقدرات، وطلب جاهز للاستخدام لنموذج OmniHuman-1.5.
مقارنة النماذج
omnihuman-1-5
متاحByteDanceفيديوغير متزامن
السعر
ابتداءً من $0.1325
الأنماط
فيديو

عن OmniHuman-1.5

OmniHuman-1.5 هو نموذج فيديو رقمي بشري من مختبر Intelligent Creation التابع لشركة ByteDance. من صورة واحدة لشخص، ومقطع صوتي، ومطالبة نصية اختيارية، يقوم النموذج بإنشاء فيديو لشخصية تتحدث أو تؤدي حركات مع مزامنة الشفاه، والإيماءات، وحركة الجسم التي تتبع الكلام. صُمم النموذج للشخصيات التي تبدو وكأنها تتفاعل، بما في ذلك المشاهد التي تضم أكثر من متحدث.

نقاط القوة

  • يقوم بتحريك صورة ثابتة واحدة، لذا لا حاجة لتصوير لقطات فيديو للشخص.
  • تتبع مزامنة الشفاه الصوت المقدم، ويتم اختيار الإيماءات لتتناسب مع معنى الكلام.
  • يمكن لمطالبة نصية اختيارية توجيه الحركة أو سلوك الكاميرا بالإضافة إلى الصوت.
  • يدعم المشاهد التي تعتمد على صوت شخصين، مع تفاعل الشخصيات مع بعضها البعض.

متى تستخدم نموذجاً آخر

  • يحتاج النموذج إلى مسار صوتي؛ فهو ليس نموذجاً عاماً لتحويل النص إلى فيديو للمشاهد التي لا تحتوي على متحدث.
  • تعتمد جودة المخرجات على الصورة المرجعية، كما أن الوجه المقصوص أو منخفض الدقة يحد من دقة الهوية.
  • تثير الأشخاص والأصوات المولدة أسئلة حول الموافقة، لذا استخدم فقط الصور والأصوات التي تمتلك حقوقها.

البدء

  1. إنشاء مفتاح API

    أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.

  2. إرسال طلبك الأول

    انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).

    صورة إلى فيديونقطة اتصال TokenLab
    POST/v1/videos/generations
    curl -X POST "https://api.tokenlab.sh/v1/videos/generations" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "image-to-video",
      "model": "omnihuman-1-5",
      "prompt": "Cinematic sunrise over a calm lake with gentle camera motion.",
      "image_url": "https://example.com/image.jpg"
    }'

التسعير

السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.

صورة إلى فيديو

لكل ثانية
السعر الرسمي
$0.1325
Official
$0.1325
خصم
—

الاستخدام والنشاط

معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.

الاستخدام والتوفر

آخر 24 ساعة
الطلبات
معدل النجاح
زمن الاستجابة P95
إجمالي الرموز
أداء النموذج
تظهر المقاييس بمجرد استيفاء حدود الخصوصية وحجم البيانات.

تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.

فتح في Console

افتح OmniHuman-1.5 في Console وجهز الرسالة للتعديل أو الإرسال.

ساعدني في الإنشاء باستخدام omnihuman-1-5 عبر image-to-video في /v1/videos/generations. اعرض النتيجة والحالة والتكلفة.

حالات الاستخدام

  • مقدمو العروض المتحدثون

    حول صورة شخصية ومسار سردي إلى فيديو لمتحدث رسمي للتدريب، أو تحديثات المنتجات، أو الشروحات.

  • حوار الشخصيات

    حرك شخصيات مصورة أو فوتوغرافية وهي تنطق سطراً مكتوباً للقصص القصيرة ومقاطع التواصل الاجتماعي.

  • فيديو مترجم محلياً

    أعد استخدام صورة مقدم عرض واحد مع صوت مسجل بعدة لغات، لإنتاج مقطع متوافق مع مزامنة الشفاه لكل لغة.

أمثلة Prompt

امرأة على مكتب تتحدث إلى الكاميرا، إيماءات هادئة، تومئ برأسها قليلاً في نقاط رئيسية

صديقان على مقعد في حديقة يتحدثان إلى بعضهما البعض، يلتفتان نحو الشخص الذي يتحدث

المغني يؤدي على مسرح صغير، حركات يد تعبيرية، الكاميرا تظل ثابتة

FAQ

ما هي المدخلات التي يقبلها OmniHuman-1.5؟

صورة واحدة للشخصية، ومقطع صوتي، ومطالبة نصية اختيارية. تحدد الصورة الهوية والمظهر، ويقود الصوت مزامنة الشفاه والتوقيت، ويمكن للمطالبة توجيه الحركة.

هل يمكنه إنشاء مقاطع فيديو تضم أكثر من شخص؟

نعم. تصف ByteDance دعم الصوت بمتحدثين اثنين، بحيث يمكن إنشاء التفاعل بين الشخصيات في مقطع واحد، وتتبع حركة كل شخص كلامه الخاص.

كيف يقرر OmniHuman-1.5 كيفية تحرك الشخصية الرمزية (الأفاتار)؟

تصف ورقة ByteDance نموذج لغة متعدد الوسائط يخطط للحركة بناءً على الصوت والصورة والمطالبة، ومحول انتشار (diffusion transformer) يقوم بتجسيد الحركة. يهدف ذلك إلى جعل الإيماءات تتناسب مع المحتوى بدلاً من تكرارها بشكل عام.

هل هو مولد فيديو عام؟

لا. هو متخصص للأشخاص الذين يتحدثون أو يؤدون بناءً على صوت. بالنسبة للمشاهد، أو المناظر الطبيعية، أو لقطات الحركة بدون مسار صوتي توجيهي، استخدم نموذجاً عاماً لتحويل النص إلى فيديو أو الصورة إلى فيديو.

كم تكلفة OmniHuman-1.5؟

على TokenLab تكلف OmniHuman-1.5 $0.1325 لكل ثانية. التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.

ما نقطة النهاية التي يجب أن يستخدمها OmniHuman-1.5؟

استخدم https://api.tokenlab.sh/v1/videos/generations كافتراضي لـ OmniHuman-1.5. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.

ما العمليات التي يدعمها OmniHuman-1.5؟

OmniHuman-1.5 يدعم صورة إلى فيديو. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.

مقارنة OmniHuman-1.5

المصادر

تمت المراجعة في ٠٢‏/١٠‏/٢٠٢٦

نماذج ذات صلة