اختر Auto أو TokenLab Verified أو Official لكل طلب، مع عرض الأسعار مسبقاً.اطلع على الجديد

xAI: Grok Voice TTS

ينشئ Grok Voice TTS كلاماً من نص مكتوب بصوت ولغة مختارين. وهو يناسب السرد المترجم، والإشعارات المنطوقة، والتطبيقات التي تحتاج إلى تقديم نص معد كاستجابة صوتية.
مقارنة النماذج
grok-voice-tts
متاحxAIتحويل النص إلى كلاممتزامن
الإدخال / الإخراج
$15.00 / $0.00
الأنماط
صوت

عن Grok Voice TTS

Grok Voice TTS هو نموذج xAI لتحويل النص إلى كلام، حيث يقوم بتحويل النص المكتوب إلى صوت منطوق بصوت ولغة مختارين. تعمل العلامات المضمنة مثل التوقفات المؤقتة، والضحك، والهمس على تشكيل طريقة الإلقاء. استخدمه للسرد، والإشعارات المنطوقة، والإجابات الصوتية المترجمة حيث يكون النص مكتوباً بالفعل ولا توجد حاجة لمحادثة حية.

نقاط القوة

  • تمنح علامات الكلام المضمنة مثل [pause] و [laugh]، بالإضافة إلى علامات التغليف مثل whisper، تحكماً في الإلقاء داخل النص نفسه.
  • تتحدث جميع الأصوات المدمجة باللغات المدعومة، لذا يمكن لهوية صوتية واحدة أن تستمر عبر الإصدارات المترجمة من نفس المحتوى.
  • يمكن استنساخ الأصوات المخصصة من مقطع مرجعي قصير لأصوات العلامات التجارية أو الشخصيات.
  • يمكن إرجاع طوابع زمنية على مستوى الحرف لمزامنة التسميات التوضيحية أو حركة الشفاه مع الصوت.

متى تستخدم نموذجاً آخر

  • إنه يتحدث نصاً ثابتاً؛ المتصل الذي يقاطع أو يرد يحتاج إلى نموذج صوتي للمحادثة بدلاً من ذلك.
  • تعتمد جودة الإخراج للنصوص الطويلة على علامات الترقيم والعلامات الموجودة في النص المصدر، لذا قد يبدو النص الآلي غير المحرر رتيباً.

البدء

  1. إنشاء مفتاح API

    أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.

  2. إرسال طلبك الأول

    انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).

    تحويل النص إلى كلامنقطة اتصال TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

التسعير

السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.

التسعير

لكل مليون حرف
Official
المدخلات$15.00/مليون حرفالمخرجات$0.00/مليون حرف
السعر الرسمي
المدخلات$15.00/مليون حرفالمخرجات$0.00/مليون حرف

الاستخدام والنشاط

معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.

الاستخدام والتوفر

آخر 24 ساعة
الطلبات
معدل النجاح
زمن الاستجابة P95
إجمالي الرموز
أداء النموذج
تظهر المقاييس بمجرد استيفاء حدود الخصوصية وحجم البيانات.

تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.

فتح في Console

افتح Grok Voice TTS في Console وجهز الرسالة للتعديل أو الإرسال.

ساعدني في تجربة grok-voice-tts بطلب صوتي قصير في /v1/audio/speech. اعرض النتيجة والتكلفة.

حالات الاستخدام

  • المقالات والدروس المسموعة

    حول مقالاً جاهزاً أو نص دورة تدريبية إلى مسار صوتي، باستخدام التوقفات المؤقتة للفصل بين الأقسام.

  • التنبيهات المنطوقة

    اقرأ تحديثات الطلبات أو إشعارات السلامة بلغة المستخدم عبر ترميز هاتفي.

  • مقاطع فيديو المنتجات المترجمة

    انطق نفس النص بعدة لغات بصوت واحد مختار، ثم استخدم الطوابع الزمنية لمحاذاة التسميات التوضيحية.

أمثلة Prompt

اقرأ هذه الفقرة بصوت دافئ وثابت وأضف [pause] قصيراً بعد كل جملة.

انطق الإشعار التالي بالفرنسية، ثم كرره بالألمانية، باستخدام نفس الصوت.

<whisper>تم شحن طردك.</whisper> [pause] يجب أن يصل يوم الخميس.

FAQ

ماذا يفعل Grok Voice TTS؟

يقوم بتحويل النص إلى صوت منطوق. تختار صوتاً، ورمز لغة اختيارياً، وتنسيق إخراج، وسيعيد الصوت للنص، بما في ذلك أي علامات تعبيرية كتبتها ضمن النص.

ما هي تنسيقات الصوت التي يمكنه إنتاجها؟

MP3، وWAV، وPCM الخام، بالإضافة إلى ترميزات الهاتف mu-law وA-law، بمعدلات عينة من 8 كيلو هرتز إلى 48 كيلو هرتز. تناسب ترميزات الهاتف أنظمة الاتصال؛ بينما يناسب MP3 تشغيل الويب والهواتف المحمولة.

كم عدد اللغات التي يمكنه التحدث بها؟

توثق xAI عشرين لغة محددة بواسطة رمز BCP-47، مع توفر الكشف التلقائي عن اللغة كبديل. يمكن لكل صوت مدمج التحدث بجميع اللغات المدعومة، لذا فإن تبديل اللغة لا يتطلب صوتاً جديداً.

هل يمكنني بث الصوت بينما لا يزال النص قيد الوصول؟

نعم. تقوم نقطة نهاية WebSocket بإنشاء الصوت في الوقت الفعلي أثناء إرسال النص، مما يساعد عندما لا يزال نموذج آخر يكتب الرد الذي سيتم نطقه.

هل يمكنني إصلاح الكلمات التي تُنطق بشكل خاطئ؟

نعم. تسمح لك بدائل النطق بتعيين مصطلح مكتوب إلى كيفية نطقه الصحيح، بحيث تظهر أسماء العلامات التجارية والاختصارات بشكل صحيح دون تعديل النص المعروض.

كم تكلفة Grok Voice TTS؟

على TokenLab تكلف Grok Voice TTS المدخلات $15.00 / المخرجات $0.00 لكل مليون حرف. التفاصيل الكاملة في جدول التسعير أعلاه.

ما نقطة النهاية التي يجب أن يستخدمها Grok Voice TTS؟

استخدم https://api.tokenlab.sh/v1/audio/speech كافتراضي لـ Grok Voice TTS. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.

ما العمليات التي يدعمها Grok Voice TTS؟

Grok Voice TTS يدعم تحويل النص إلى كلام. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.

مقارنة Grok Voice TTS

المصادر

تمت المراجعة في ٠٢‏/١٠‏/٢٠٢٦

المزيد من Grok Voice

نماذج ذات صلة