Alibaba: Fun-ASR Realtime
fun-asr-realtime- السعر
- ابتداءً من $0.00009
- الأنماط
- صوت
عن Fun-ASR Realtime
Fun-ASR Realtime هو نموذج التعرف على الكلام بالبث المباشر من Alibaba: يستقبل الصوت عبر جلسة مباشرة ويعيد النص أثناء تحدث الأشخاص. إنه البديل من Fun-ASR المخصص للترجمة الفورية، ومدخلات الصوت، والمساعدة أثناء المكالمات، حيث يجبر Fun-ASR الخاص بالصوت المسجل المستخدمين على الانتظار حتى انتهاء التسجيل. تدرج Alibaba الكلمات المفتاحية (hotwords)، والطوابع الزمنية، واللغة الماندرين بلهجات مثل الكانتونية والسيتشوانية.
نقاط القوة
- يبث نصاً جزئياً بينما لا يزال المتحدث يتحدث، بحيث تظهر الترجمة دون انتظار انتهاء التسجيل.
- يتعرف على لغة الماندرين بدقة عالية والعديد من اللهجات، بما في ذلك الكانتونية والسيتشوانية، وفقاً لتوثيق Alibaba.
- توجه الكلمات المفتاحية المخصصة التعرف المباشر نحو الأسماء والمصطلحات الخاصة بمنتجك.
- تصل الطوابع الزمنية على مستوى الكلمات والجمل مع البث، مما يساعد في مواءمة الترجمة.
متى تستخدم نموذجاً آخر
- يتطلب جلسة WebSocket، وهو ما يمثل جهداً أكبر في التكامل مقارنة بتحميل تسجيل إلى Fun-ASR.
- لا يمكن لفك التشفير المباشر إعادة فحص الصوت السابق، لذا بالنسبة لدقة الأرشفة، يعد Fun-ASR الخاص بالصوت المسجل الخيار الأكثر أماناً.
البدء
إنشاء مفتاح API
أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.
إرسال طلبك الأول
انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).
صوت إلى نصWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
التسعير
السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.
الوقت الفعلي / صوت إلى نص
لكل ثانية- السعر الرسمي
- $0.00009
- Official
- $0.00009
- خصم
- —
| السعر الرسميلكل ثانية | Officialلكل ثانية | خصم | |
|---|---|---|---|
| الوقت الفعلي / صوت إلى نص | $0.00009 | $0.00009 | — |
الاستخدام والنشاط
معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.
الاستخدام والتوفر
آخر 24 ساعة- الطلبات
- معدل النجاح
- زمن الاستجابة P95
- إجمالي الرموز
تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.
فتح في Console
افتح Fun-ASR Realtime في Console وجهز الرسالة للتعديل أو الإرسال.
ساعدني في تجربة fun-asr-realtime بطلب صوتي قصير في /v1/realtime. اعرض النتيجة والتكلفة.
حالات الاستخدام
الترجمة الفورية المباشرة
عرض ترجمة لندوة عبر الإنترنت أو حدث أثناء تحدث المتحدث، مع تحديث كل جملة بمجرد استقرارها.
مدخلات الصوت
السماح للمستخدمين بالإملاء في نموذج أو مربع دردشة ورؤية كلماتهم تظهر أثناء تحدثهم.
المساعدون المدركون للهجات
التعامل مع الطلبات المنطوقة باللغة الماندرين واللهجات الإقليمية في تطبيق لا يمكنه انتظار تسجيل كامل.
أمثلة Prompt
بث صوت الميكروفون لإطلاق منتج باللغة الماندرين وطباعة الترجمة مع انتهاء كل جملة.
نسخ مكالمة عميل كانتونية مباشرة مع الكلمات المفتاحية 'استرداد' و'رقم الطلب'.
بث جلسة تدريبية والاحتفاظ بطوابع زمنية للكلمات للتقطيع اللاحق.
FAQ
متى يجب أن أختار Fun-ASR Realtime بدلاً من Fun-ASR؟
اختر Realtime عندما يجب أن يظهر النص أثناء نطق الصوت، مثل الترجمة أو الإملاء. اختر Fun-ASR الخاص بالصوت المسجل عندما يكون لديك تسجيل جاهز وتريد تحديد هوية المتحدث (diarization) أو دقة الأرشفة.
كيف أرسل الصوت إليه؟
عبر جلسة WebSocket للبث، إما من خلال DashScope SDK الخاص بـ Alibaba أو البروتوكول الخام. تقوم بدفع أجزاء الصوت وتلقي أحداث النص المعترف به أثناء استمرار الجلسة.
هل يدعم اللهجات؟
نعم. يدرج توثيق Alibaba للوقت الفعلي لغة الماندرين بالإضافة إلى الكانتونية، والسيتشوانية، ولهجات أخرى، إلى جانب الكلمات المفتاحية المخصصة التي تساعد في الأسماء ومصطلحات المنتج. يتم التعرف على الكلام باللهجات في نفس الجلسة المباشرة مثل لغة الماندرين القياسية.
هل يمكنه التعامل مع الصمت بين الجمل؟
نعم، يتضمن كشف نشاط الصوت الذي يقوم بتصفية الصوت غير الكلامي ويقرر أين تنتهي الجمل. عتبات الصمت قابلة للتهيئة في إعدادات الجلسة، لذا يمكنك ضبط مدى سرعة استقرار الترجمة.
كم تكلفة Fun-ASR Realtime؟
على TokenLab تكلف Fun-ASR Realtime $0.00009 لكل ثانية. التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.
ما نقطة النهاية التي يجب أن يستخدمها Fun-ASR Realtime؟
استخدم https://api.tokenlab.sh/v1/realtime كافتراضي لـ Fun-ASR Realtime. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.
ما العمليات التي يدعمها Fun-ASR Realtime؟
Fun-ASR Realtime يدعم صوت إلى نص. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.
مقارنة Fun-ASR Realtime
المصادر
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
تمت المراجعة في ٠٢/١٠/٢٠٢٦