xAI: Grok Voice TTS
grok-voice-tts- الإدخال / الإخراج
- $15.00 / $0.00
- الأنماط
- صوت
عن Grok Voice TTS
Grok Voice TTS هو نموذج xAI لتحويل النص إلى كلام، حيث يقوم بتحويل النص المكتوب إلى صوت منطوق بصوت ولغة مختارين. تعمل العلامات المضمنة مثل التوقفات المؤقتة، والضحك، والهمس على تشكيل طريقة الإلقاء. استخدمه للسرد، والإشعارات المنطوقة، والإجابات الصوتية المترجمة حيث يكون النص مكتوباً بالفعل ولا توجد حاجة لمحادثة حية.
نقاط القوة
- تمنح علامات الكلام المضمنة مثل [pause] و [laugh]، بالإضافة إلى علامات التغليف مثل whisper، تحكماً في الإلقاء داخل النص نفسه.
- تتحدث جميع الأصوات المدمجة باللغات المدعومة، لذا يمكن لهوية صوتية واحدة أن تستمر عبر الإصدارات المترجمة من نفس المحتوى.
- يمكن استنساخ الأصوات المخصصة من مقطع مرجعي قصير لأصوات العلامات التجارية أو الشخصيات.
- يمكن إرجاع طوابع زمنية على مستوى الحرف لمزامنة التسميات التوضيحية أو حركة الشفاه مع الصوت.
متى تستخدم نموذجاً آخر
- إنه يتحدث نصاً ثابتاً؛ المتصل الذي يقاطع أو يرد يحتاج إلى نموذج صوتي للمحادثة بدلاً من ذلك.
- تعتمد جودة الإخراج للنصوص الطويلة على علامات الترقيم والعلامات الموجودة في النص المصدر، لذا قد يبدو النص الآلي غير المحرر رتيباً.
البدء
إنشاء مفتاح API
أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.
إرسال طلبك الأول
انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).
تحويل النص إلى كلامنقطة اتصال TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
التسعير
السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.
التسعير
لكل مليون حرف- Official
- المدخلات$15.00/مليون حرفالمخرجات$0.00/مليون حرف
- السعر الرسمي
- المدخلات$15.00/مليون حرفالمخرجات$0.00/مليون حرف
| السعر الرسميلكل مليون حرف | Officialلكل مليون حرف | خصم | |
|---|---|---|---|
| المدخلات | $15.00 | $15.00 | — |
| المخرجات | $0.00 | $0.00 | — |
الاستخدام والنشاط
معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.
الاستخدام والتوفر
آخر 24 ساعة- الطلبات
- معدل النجاح
- زمن الاستجابة P95
- إجمالي الرموز
تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.
فتح في Console
افتح Grok Voice TTS في Console وجهز الرسالة للتعديل أو الإرسال.
ساعدني في تجربة grok-voice-tts بطلب صوتي قصير في /v1/audio/speech. اعرض النتيجة والتكلفة.
حالات الاستخدام
المقالات والدروس المسموعة
حول مقالاً جاهزاً أو نص دورة تدريبية إلى مسار صوتي، باستخدام التوقفات المؤقتة للفصل بين الأقسام.
التنبيهات المنطوقة
اقرأ تحديثات الطلبات أو إشعارات السلامة بلغة المستخدم عبر ترميز هاتفي.
مقاطع فيديو المنتجات المترجمة
انطق نفس النص بعدة لغات بصوت واحد مختار، ثم استخدم الطوابع الزمنية لمحاذاة التسميات التوضيحية.
أمثلة Prompt
اقرأ هذه الفقرة بصوت دافئ وثابت وأضف [pause] قصيراً بعد كل جملة.
انطق الإشعار التالي بالفرنسية، ثم كرره بالألمانية، باستخدام نفس الصوت.
<whisper>تم شحن طردك.</whisper> [pause] يجب أن يصل يوم الخميس.
FAQ
ماذا يفعل Grok Voice TTS؟
يقوم بتحويل النص إلى صوت منطوق. تختار صوتاً، ورمز لغة اختيارياً، وتنسيق إخراج، وسيعيد الصوت للنص، بما في ذلك أي علامات تعبيرية كتبتها ضمن النص.
ما هي تنسيقات الصوت التي يمكنه إنتاجها؟
MP3، وWAV، وPCM الخام، بالإضافة إلى ترميزات الهاتف mu-law وA-law، بمعدلات عينة من 8 كيلو هرتز إلى 48 كيلو هرتز. تناسب ترميزات الهاتف أنظمة الاتصال؛ بينما يناسب MP3 تشغيل الويب والهواتف المحمولة.
كم عدد اللغات التي يمكنه التحدث بها؟
توثق xAI عشرين لغة محددة بواسطة رمز BCP-47، مع توفر الكشف التلقائي عن اللغة كبديل. يمكن لكل صوت مدمج التحدث بجميع اللغات المدعومة، لذا فإن تبديل اللغة لا يتطلب صوتاً جديداً.
هل يمكنني بث الصوت بينما لا يزال النص قيد الوصول؟
نعم. تقوم نقطة نهاية WebSocket بإنشاء الصوت في الوقت الفعلي أثناء إرسال النص، مما يساعد عندما لا يزال نموذج آخر يكتب الرد الذي سيتم نطقه.
هل يمكنني إصلاح الكلمات التي تُنطق بشكل خاطئ؟
نعم. تسمح لك بدائل النطق بتعيين مصطلح مكتوب إلى كيفية نطقه الصحيح، بحيث تظهر أسماء العلامات التجارية والاختصارات بشكل صحيح دون تعديل النص المعروض.
كم تكلفة Grok Voice TTS؟
على TokenLab تكلف Grok Voice TTS المدخلات $15.00 / المخرجات $0.00 لكل مليون حرف. التفاصيل الكاملة في جدول التسعير أعلاه.
ما نقطة النهاية التي يجب أن يستخدمها Grok Voice TTS؟
استخدم https://api.tokenlab.sh/v1/audio/speech كافتراضي لـ Grok Voice TTS. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.
ما العمليات التي يدعمها Grok Voice TTS؟
Grok Voice TTS يدعم تحويل النص إلى كلام. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.
مقارنة Grok Voice TTS
المصادر
تمت المراجعة في ٠٢/١٠/٢٠٢٦