اختر Auto أو TokenLab Verified أو Official لكل طلب، مع عرض الأسعار مسبقاً.اطلع على الجديد

Alibaba: Fun-ASR Realtime

يستهلك Fun-ASR Realtime الصوت الوارد مع تقدم الجلسة. وهو مصمم لتجارب النسخ المباشر مثل التسميات التوضيحية والإدخال الصوتي، حيث يؤدي انتظار تسجيل كامل إلى مقاطعة التفاعل.
مقارنة النماذج
fun-asr-realtime
متاحAlibabaتحويل الكلام إلى نص (Speech to Text)متزامن
السعر
ابتداءً من $0.00009
الأنماط
صوت

عن Fun-ASR Realtime

Fun-ASR Realtime هو نموذج التعرف على الكلام بالبث المباشر من Alibaba: يستقبل الصوت عبر جلسة مباشرة ويعيد النص أثناء تحدث الأشخاص. إنه البديل من Fun-ASR المخصص للترجمة الفورية، ومدخلات الصوت، والمساعدة أثناء المكالمات، حيث يجبر Fun-ASR الخاص بالصوت المسجل المستخدمين على الانتظار حتى انتهاء التسجيل. تدرج Alibaba الكلمات المفتاحية (hotwords)، والطوابع الزمنية، واللغة الماندرين بلهجات مثل الكانتونية والسيتشوانية.

نقاط القوة

  • يبث نصاً جزئياً بينما لا يزال المتحدث يتحدث، بحيث تظهر الترجمة دون انتظار انتهاء التسجيل.
  • يتعرف على لغة الماندرين بدقة عالية والعديد من اللهجات، بما في ذلك الكانتونية والسيتشوانية، وفقاً لتوثيق Alibaba.
  • توجه الكلمات المفتاحية المخصصة التعرف المباشر نحو الأسماء والمصطلحات الخاصة بمنتجك.
  • تصل الطوابع الزمنية على مستوى الكلمات والجمل مع البث، مما يساعد في مواءمة الترجمة.

متى تستخدم نموذجاً آخر

  • يتطلب جلسة WebSocket، وهو ما يمثل جهداً أكبر في التكامل مقارنة بتحميل تسجيل إلى Fun-ASR.
  • لا يمكن لفك التشفير المباشر إعادة فحص الصوت السابق، لذا بالنسبة لدقة الأرشفة، يعد Fun-ASR الخاص بالصوت المسجل الخيار الأكثر أماناً.

البدء

  1. إنشاء مفتاح API

    أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.

  2. إرسال طلبك الأول

    انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).

    صوت إلى نصWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

التسعير

السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.

الوقت الفعلي / صوت إلى نص

لكل ثانية
السعر الرسمي
$0.00009
Official
$0.00009
خصم
—

الاستخدام والنشاط

معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.

الاستخدام والتوفر

آخر 24 ساعة
الطلبات
معدل النجاح
زمن الاستجابة P95
إجمالي الرموز
أداء النموذج
تظهر المقاييس بمجرد استيفاء حدود الخصوصية وحجم البيانات.

تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.

فتح في Console

افتح Fun-ASR Realtime في Console وجهز الرسالة للتعديل أو الإرسال.

ساعدني في تجربة fun-asr-realtime بطلب صوتي قصير في /v1/realtime. اعرض النتيجة والتكلفة.

حالات الاستخدام

  • الترجمة الفورية المباشرة

    عرض ترجمة لندوة عبر الإنترنت أو حدث أثناء تحدث المتحدث، مع تحديث كل جملة بمجرد استقرارها.

  • مدخلات الصوت

    السماح للمستخدمين بالإملاء في نموذج أو مربع دردشة ورؤية كلماتهم تظهر أثناء تحدثهم.

  • المساعدون المدركون للهجات

    التعامل مع الطلبات المنطوقة باللغة الماندرين واللهجات الإقليمية في تطبيق لا يمكنه انتظار تسجيل كامل.

أمثلة Prompt

بث صوت الميكروفون لإطلاق منتج باللغة الماندرين وطباعة الترجمة مع انتهاء كل جملة.

نسخ مكالمة عميل كانتونية مباشرة مع الكلمات المفتاحية 'استرداد' و'رقم الطلب'.

بث جلسة تدريبية والاحتفاظ بطوابع زمنية للكلمات للتقطيع اللاحق.

FAQ

متى يجب أن أختار Fun-ASR Realtime بدلاً من Fun-ASR؟

اختر Realtime عندما يجب أن يظهر النص أثناء نطق الصوت، مثل الترجمة أو الإملاء. اختر Fun-ASR الخاص بالصوت المسجل عندما يكون لديك تسجيل جاهز وتريد تحديد هوية المتحدث (diarization) أو دقة الأرشفة.

كيف أرسل الصوت إليه؟

عبر جلسة WebSocket للبث، إما من خلال DashScope SDK الخاص بـ Alibaba أو البروتوكول الخام. تقوم بدفع أجزاء الصوت وتلقي أحداث النص المعترف به أثناء استمرار الجلسة.

هل يدعم اللهجات؟

نعم. يدرج توثيق Alibaba للوقت الفعلي لغة الماندرين بالإضافة إلى الكانتونية، والسيتشوانية، ولهجات أخرى، إلى جانب الكلمات المفتاحية المخصصة التي تساعد في الأسماء ومصطلحات المنتج. يتم التعرف على الكلام باللهجات في نفس الجلسة المباشرة مثل لغة الماندرين القياسية.

هل يمكنه التعامل مع الصمت بين الجمل؟

نعم، يتضمن كشف نشاط الصوت الذي يقوم بتصفية الصوت غير الكلامي ويقرر أين تنتهي الجمل. عتبات الصمت قابلة للتهيئة في إعدادات الجلسة، لذا يمكنك ضبط مدى سرعة استقرار الترجمة.

كم تكلفة Fun-ASR Realtime؟

على TokenLab تكلف Fun-ASR Realtime $0.00009 لكل ثانية. التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.

ما نقطة النهاية التي يجب أن يستخدمها Fun-ASR Realtime؟

استخدم https://api.tokenlab.sh/v1/realtime كافتراضي لـ Fun-ASR Realtime. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.

ما العمليات التي يدعمها Fun-ASR Realtime؟

Fun-ASR Realtime يدعم صوت إلى نص. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.

مقارنة Fun-ASR Realtime

المصادر

تمت المراجعة في ٠٢‏/١٠‏/٢٠٢٦

المزيد من Fun-ASR

نماذج ذات صلة