الصوت والوقت الفعلي
إنشاء كلام
ينشئ صوتًا من النص المُدخل
نص الطلب
يعتمد نمط الاستجابة على النموذج المحدد وstream_format. للمدخلات الطويلة، اضبط مهلة عميل HTTP على 120s على الأقل.
تختلف الحقول الاختيارية والأصوات والتنسيقات ودعم SSE حسب النموذج. راجع GET /v1/models/{model} قبل إرسالها. قد تعيد المعلمات غير المدعومة 400 unsupported_parameter.
tts-1معرّف نموذج TTS. اعرض الخيارات الحالية عبر GET /v1/models?recommended_for=tts.
النص المطلوب إنشاء صوت له. الحد الأقصى 4096 حرفًا.
محدد الصوت. مرر اسم صوت مدمج مثل nova، أو صوت Gemini مثل Kore، أو كائنًا مثل { "id": "voice-id" } للأصوات المخصصة المتوافقة.
معرّف صوت للنماذج التي تدعم هذه المعلمة، مثل نماذج الكلام المتوافقة مع MiniMax.
تعليمات اختيارية للأسلوب أو الإلقاء لنماذج TTS المتوافقة مع OpenAI التي تدعمها.
Prompt اختياري لأسلوب الإلقاء في نماذج Gemini TTS.
رمز لغة اختياري، مثل en-US، لمسارات Gemini وxAI وTTS المتوافقة.
تنسيق الصوت. تشمل القيم الشائعة mp3 وopus وaac وflac وwav وpcm؛ تختلف القيم المدعومة حسب عائلة النموذج.
audioتنسيق التسليم في TokenLab: audio أو sse. لا يدعم tts-1 وtts-1-hd القيمة stream_format=sse.
سرعة الكلام لعائلات النماذج التي تدعمها (من 0.25 إلى 4.0).
درجة حرارة العينة لمسارات Gemini-compatible TTS (من 0 إلى 2).
الاستجابة
تعيد stream_format=audio بايتات صوتية. تعيد النماذج الداعمة لـ stream_format=sse استجابة text/event-stream؛ حلّل أحداثها بدلاً من حفظ الاستجابة كاملة كملف صوتي.
الطلب
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3عينات الأصوات
تعتمد الأصوات المتاحة على النموذج. الأسماء أدناه أمثلة وليست قائمة مشتركة لجميع نماذج TTS.
| الصوت | الوصف |
|---|---|
alloy | محايد، متوازن |
ash | هادئ، متزن |
ballad | لحني، تعبيري |
coral | دافئ، جذاب |
echo | دافئ، حواري |
fable | تعبيري، سردي |
nova | ودود، واضح |
onyx | عميق، موثوق |
sage | حكيم، متأمل |
shimmer | ناعم، لطيف |
verse | ديناميكي، متعدد الاستخدامات |
الاستجابة
<binary audio data>حقول مهمة
نوع وسائط استجابة HTTP: تنسيق صوتي أو text/event-stream عند استخدام SSE.
بايتات صوتية مع audio، وتدفق أحداث مع sse. اختر طريقة التحليل وفق Content-Type والنمط المطلوب.
يحوّل MiniMax Speech 2.8 Turbo النص المكتوب إلى كلام بصوت مختار عبر مسار عمل يركز على السرعة. يفيد في الواجهات الصوتية سريعة الاستجابة والتعليق الصوتي.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}التفويض
BearerAuth مصادقة مفتاح API. قم بإنشاء أو إدارة مفاتيح API في Dashboard > API > API Keys.
الموضع: header
الترويسات
سياسة التسليم لكل طلب. تتجاوز إعدادات API key و Workspace الافتراضية. يحاول النظام تلقائياً استخدام TokenLab Verified أولاً، وقد ينتقل مرة واحدة إلى Official فقط قبل المخرجات، أو قبول الطلب، أو إنشاء مورد دائم.
القيم المتاحة
- "auto"
- "verified"
- "official"
جسم الطلب
application/json
الاستجابة
application/json
application/json
application/json
application/json
application/json
application/json