الصوت والوقت الفعلي

إنشاء تفريغ صوتي

يحوّل الصوت إلى نص باللغة الأصلية للإدخال

POST
/v1/audio/transcriptions

جسم الطلب

قد يعيد التفريغ النص مباشرة أو يقبل مهمة غير متزامنة مع HTTP 200 وid وstatus. للمهمة المقبولة، اتبع poll_url أو استعلم عن /v1/tasks/{id}. للصوت الطويل الذي يُعالج تزامنيًا، اسمح بمهلة لا تقل عن 120s.

filefileمطلوب

ملف الصوت المراد تفريغه. التنسيقات المدعومة: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. الحد الأقصى لحجم الملف: 25 MB.

modelstringالافتراضي: whisper-1

معرّف نموذج التفريغ، مثل whisper-1 أو gpt-4o-transcribe. اعرض الخيارات الحالية عبر GET /v1/models?recommended_for=stt.

languagestring

لغة الصوت بتنسيق ISO-639-1 (على سبيل المثال: en, zh, ja).

promptstring

نص اختياري لتوجيه أسلوب النموذج أو متابعة مقطع سابق.

response_formatstringالافتراضي: json

تنسيق الإخراج. يدعم Whisper القيم json وtext وsrt وverbose_json وvtt. قد تختلف التنسيقات في النماذج الأخرى؛ راجع تفاصيل النموذج.

temperaturenumber

درجة حرارة أخذ العينات من 0 إلى 1، للنماذج التي تدعم هذه المعلمة فقط.

timestamp_granularitiesarray

word و/أو segment إذا كان النموذج يدعمهما. يتطلب Whisper القيمة response_format=verbose_json. في multipart، كرّر timestamp_granularities[] لإرسال عدة قيم.

الاستجابة

تصف الحقول التالية استجابات JSON للتفريغ أو الترجمة. تعيد text وsrt وvtt نصًا أو ترجمة مصاحبة خامًا بدلاً من كائن JSON. تعتمد الحقول الإضافية على النموذج وتنسيق الإخراج.

textstring

النص المُفرَّغ.

بالنسبة إلى verbose_json:

taskstring

اسم المهمة عند إرجاعه، مثل transcribe.

languagestring

اللغة المكتشفة.

durationnumber

مدة الصوت بالثواني.

segmentsarray

مقاطع التفريغ مع الطوابع الزمنية.

wordsarray

طوابع زمنية على مستوى الكلمات (إذا تم طلبها).

تعيد مهمة التفريغ غير المتزامنة المقبولة الحقول التالية بدلاً من النص:

idstring

معرف المهمة.

task_idstring

الاسم البديل لمعرّف المهمة غير المتزامنة عندما يكون متاحًا.

statusstring

حالة المهمة: pending أو processing أو completed أو failed.

poll_urlstring

عنوان URL المفضل للاستعلام عند توفيره في استجابة الإنشاء.

الطلب

curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="en"

الاستجابة

{
  "text": "Hello, this is a test of the transcription API."
}

الترجمة

لترجمة الصوت إلى الإنجليزية، استخدم endpoint الخاص بالترجمات:

with open("audio.mp3", "rb") as audio_file:
    response = client.audio.translations.create(
        model="whisper-1",
        file=audio_file
    )

print(response.text)

التفويض

BearerAuth
AuthorizationBearer <token>

مصادقة مفتاح API. قم بإنشاء أو إدارة مفاتيح API في Dashboard > API > API Keys.

الموضع: header

الترويسات

X-TokenLab-Delivery-Policy?string

سياسة التسليم لكل طلب. تتجاوز إعدادات API key و Workspace الافتراضية. يحاول النظام تلقائياً استخدام TokenLab Verified أولاً، وقد ينتقل مرة واحدة إلى Official فقط قبل المخرجات، أو قبول الطلب، أو إنشاء مورد دائم.

القيم المتاحة

  • "auto"
  • "verified"
  • "official"

جسم الطلب

multipart/form-data

الاستجابة

application/json

application/json

application/json

application/json

application/json

application/json