الصوت والوقت الفعلي

إنشاء كلام

ينشئ صوتًا من النص المُدخل

POST
/v1/audio/speech

نص الطلب

يعتمد نمط الاستجابة على النموذج المحدد وstream_format. للمدخلات الطويلة، اضبط مهلة عميل HTTP على 120s على الأقل.

تختلف الحقول الاختيارية والأصوات والتنسيقات ودعم SSE حسب النموذج. راجع GET /v1/models/{model} قبل إرسالها. قد تعيد المعلمات غير المدعومة 400 unsupported_parameter.

modelstringالافتراضي: tts-1

معرّف نموذج TTS. اعرض الخيارات الحالية عبر GET /v1/models?recommended_for=tts.

inputstringمطلوب

النص المطلوب إنشاء صوت له. الحد الأقصى 4096 حرفًا.

voicestring | object

محدد الصوت. مرر اسم صوت مدمج مثل nova، أو صوت Gemini مثل Kore، أو كائنًا مثل { "id": "voice-id" } للأصوات المخصصة المتوافقة.

voice_idstring

معرّف صوت للنماذج التي تدعم هذه المعلمة، مثل نماذج الكلام المتوافقة مع MiniMax.

instructionsstring

تعليمات اختيارية للأسلوب أو الإلقاء لنماذج TTS المتوافقة مع OpenAI التي تدعمها.

promptstring

Prompt اختياري لأسلوب الإلقاء في نماذج Gemini TTS.

language_codestring

رمز لغة اختياري، مثل en-US، لمسارات Gemini وxAI وTTS المتوافقة.

response_formatstring

تنسيق الصوت. تشمل القيم الشائعة mp3 وopus وaac وflac وwav وpcm؛ تختلف القيم المدعومة حسب عائلة النموذج.

stream_formatstringالافتراضي: audio

تنسيق التسليم في TokenLab: audio أو sse. لا يدعم tts-1 وtts-1-hd القيمة stream_format=sse.

speednumber

سرعة الكلام لعائلات النماذج التي تدعمها (من 0.25 إلى 4.0).

temperaturenumber

درجة حرارة العينة لمسارات Gemini-compatible TTS (من 0 إلى 2).

الاستجابة

تعيد stream_format=audio بايتات صوتية. تعيد النماذج الداعمة لـ stream_format=sse استجابة text/event-stream؛ حلّل أحداثها بدلاً من حفظ الاستجابة كاملة كملف صوتي.

الطلب

curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-hd",
    "voice": "nova",
    "input": "Hello, welcome to TokenLab!"
  }' \
  --output speech.mp3

عينات الأصوات

تعتمد الأصوات المتاحة على النموذج. الأسماء أدناه أمثلة وليست قائمة مشتركة لجميع نماذج TTS.

الصوتالوصف
alloyمحايد، متوازن
ashهادئ، متزن
balladلحني، تعبيري
coralدافئ، جذاب
echoدافئ، حواري
fableتعبيري، سردي
novaودود، واضح
onyxعميق، موثوق
sageحكيم، متأمل
shimmerناعم، لطيف
verseديناميكي، متعدد الاستخدامات

الاستجابة

200 OK
<binary audio data>

حقول مهمة

Content-Typestring

نوع وسائط استجابة HTTP: تنسيق صوتي أو text/event-stream عند استخدام SSE.

bodybinary | SSE

بايتات صوتية مع audio، وتدفق أحداث مع sse. اختر طريقة التحليل وفق Content-Type والنمط المطلوب.

يحوّل MiniMax Speech 2.8 Turbo النص المكتوب إلى كلام بصوت مختار عبر مسار عمل يركز على السرعة. يفيد في الواجهات الصوتية سريعة الاستجابة والتعليق الصوتي.

{
  "model": "speech-2.8-turbo",
  "input": "Welcome to TokenLab.",
  "voice_id": "male-qn-qingse",
  "speed": 1,
  "response_format": "mp3",
  "stream_format": "audio"
}

التفويض

BearerAuth
AuthorizationBearer <token>

مصادقة مفتاح API. قم بإنشاء أو إدارة مفاتيح API في Dashboard > API > API Keys.

الموضع: header

الترويسات

X-TokenLab-Delivery-Policy?string

سياسة التسليم لكل طلب. تتجاوز إعدادات API key و Workspace الافتراضية. يحاول النظام تلقائياً استخدام TokenLab Verified أولاً، وقد ينتقل مرة واحدة إلى Official فقط قبل المخرجات، أو قبول الطلب، أو إنشاء مورد دائم.

القيم المتاحة

  • "auto"
  • "verified"
  • "official"

جسم الطلب

application/json

الاستجابة

application/json

application/json

application/json

application/json

application/json

application/json