اختر Auto أو TokenLab Verified أو Official لكل طلب، مع عرض الأسعار مسبقاً.اطلع على الجديد

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign هو نموذج تحويل النص إلى كلام من Alibaba ينشئ أصواتاً مخصصة من أوصاف اللغة الطبيعية التي تحدد العاطفة، والنبرة، والإيقاع. يدعم استنساخ الصوت من عينة صوتية مدتها 3 ثوانٍ، ويولد الكلام بأكثر من 10 لغات بما في ذلك الصينية، والإنجليزية، واليابانية، والكورية، واللغات الأوروبية، ويحقق زمن انتقال منخفض يصل إلى 97 مللي ثانية.
مقارنة النماذج
qwen3-tts-1-7b-voicedesign
متاحAlibabaتحويل النص إلى كلاممتزامن
السعر
ابتداءً من $0.000015
الأنماط
صوت

عن Qwen3-TTS 1.7B VoiceDesign

نموذج Qwen3-TTS 1.7B VoiceDesign هو متغير تحويل النص إلى كلام من Alibaba يقوم بإنشاء صوت من وصف مكتوب بدلاً من قائمة محددة مسبقاً. أنت تصف العاطفة والنبرة وطبقة الصوت بلغة طبيعية، ويتحدث النموذج النص بهذا الصوت. يغطي النموذج عشر لغات وهو مخصص للحالات التي لا يتناسب فيها أي متحدث موجود مع الشخصية أو العلامة التجارية التي تفكر فيها.

نقاط القوة

  • يتم تحديد الصوت من خلال وصف، مثل "راوٍ مسن ذو أداء بطيء ودافئ"، بدلاً من اختياره من قائمة ثابتة.
  • يمكن توجيه جرس الصوت والعاطفة وطبقة الصوت من خلال التعليمات، بما في ذلك الحالات المزاجية القوية مثل الغضب.
  • يتم تغطية عشر لغات: الصينية، الإنجليزية، اليابانية، الكورية، الألمانية، الفرنسية، الروسية، البرتغالية، الإسبانية، والإيطالية، بالإضافة إلى متغيرات اللهجات.
  • تدرج Alibaba زمن انتقال منخفض للتوليف يبلغ حوالي 97 مللي ثانية لعائلة Qwen3-TTS، لذا فهو مناسب للاستخدام التفاعلي.

متى تستخدم نموذجاً آخر

  • يمكن أن ينتج عن الوصف نفسه أصوات مختلفة قليلاً في مكالمات مختلفة، لذا فهو خيار أضعف عندما يجب تكرار صوت واحد بدقة لأشهر.
  • إذا كنت تريد متحدثاً محدداً بالاسم، فإن متغير CustomVoice مع الإعدادات التسعة المسبقة يكون أكثر قابلية للتنبؤ.
  • تعتمد الجودة على مدى وضوح وصفك للصوت؛ الأوصاف الغامضة تعطي نتائج عامة.

البدء

  1. إنشاء مفتاح API

    أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.

  2. إرسال طلبك الأول

    انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).

    تحويل النص إلى كلامنقطة اتصال TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

التسعير

السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.

تحويل النص إلى كلام

لكل مليون حرف
السعر الرسمي
$0.000015
Official
$0.000015
خصم
—

الاستخدام والنشاط

معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.

الاستخدام والتوفر

آخر 24 ساعة
الطلبات
معدل النجاح
زمن الاستجابة P95
إجمالي الرموز
أداء النموذج
تظهر المقاييس بمجرد استيفاء حدود الخصوصية وحجم البيانات.

تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.

فتح في Console

افتح Qwen3-TTS 1.7B VoiceDesign في Console وجهز الرسالة للتعديل أو الإرسال.

ساعدني في تجربة qwen3-tts-1-7b-voicedesign بطلب صوتي قصير في /v1/audio/speech. اعرض النتيجة والتكلفة.

حالات الاستخدام

  • أصوات الشخصيات للألعاب

    صف كل شخصية، على سبيل المثال "حداد قزم فظ" أو "ساعٍ شاب متوتر"، وقم بإنشاء الحوارات دون الحاجة لتوظيف ممثل صوتي أولاً.

  • استكشاف صوت العلامة التجارية

    جرب عدة أوصاف لصوت الشركة، مثل "واثق ومنخفض" مقابل "مشرق وسريع"، وقارن بينها على النص نفسه.

  • السرد التعبيري

    أداء مباشر لأقسام القصة مع تعليمات مثل "خافت ومتوتر"، ثم "مرتاح ودافئ"، ضمن مشروع واحد.

  • نماذج أولية للأصوات للفيديو

    أنشئ راوياً مؤقتاً للوحة القصة أو الفيديو التوضيحي قبل اختيار الصوت النهائي.

أمثلة Prompt

الصوت: امرأة في منتصف العمر، هادئة ومنخفضة، تتحدث ببطء مثل راوي الأفلام الوثائقية. النص: غير النهر مجراه ثلاث مرات في القرن الماضي.

الصوت: شاب، متحمس ويشعر بضيق تنفس طفيف، وتيرة سريعة. النص: لن تصدق ما دخل للتو من الباب.

الصوت: تحدث بنبرة غاضبة بشكل خاص، سريعة ومقتضبة (用特别愤怒的语气说). النص: 这已经是第三次了,你们到底有没有在听?

FAQ

ما الغرض من Qwen3-TTS VoiceDesign؟

إنه يولد الكلام بصوت تحدده بالكلمات. بدلاً من اختيار متحدث محدد بالاسم، تكتب وصفاً يغطي العاطفة والنبرة والأداء، وينتج النموذج صوتاً يتبع ذلك. إنه يناسب الشخصيات وأصوات العلامات التجارية التي لا تتطابق مع إعداد مسبق جاهز.

كيف يختلف عن CustomVoice؟

يوفر CustomVoice تسعة متحدثين محددين بالاسم مع تعليمات أسلوب اختيارية. بينما لا يحتوي VoiceDesign على قائمة ثابتة ويبني الصوت من وصفك. اختر VoiceDesign لإنشاء شيء جديد وCustomVoice لمتحدث مستقر وقابل للتكرار.

ما هي اللغات المدعومة؟

عشر لغات: الصينية، الإنجليزية، اليابانية، الكورية، الألمانية، الفرنسية، الروسية، البرتغالية، الإسبانية، والإيطالية، إلى جانب بعض متغيرات اللهجات. اكتب وصف الصوت بلغة يفهمها النموذج؛ المثال الموجود في بطاقة النموذج يستخدم الصينية.

هل يمكنني استنساخ صوت شخص حقيقي به؟

تصف عائلة Qwen3-TTS استنساخ الصوت من عينة قصيرة، لكن تركيز هذا المتغير ينصب على التصميم القائم على التعليمات. قم فقط باستنساخ أو تقليد الأصوات التي لديك إذن باستخدامها، وتحقق من المخرجات مقابل قواعد الموافقة الخاصة بك.

هل سيكون الصوت متطابقاً في كل مكالمة؟

غير مضمون. يوجه الوصف الصوت ولكنه لا يثبت جرس صوت واحداً دقيقاً، لذا قد تبدو المكالمات المتكررة مختلفة قليلاً. إذا كنت بحاجة إلى تكرار دقيق عبر مشروع طويل، فاستخدم متحدثاً ثابتاً ومضبوطاً مسبقاً بدلاً من ذلك.

كم تكلفة Qwen3-TTS 1.7B VoiceDesign؟

على TokenLab تكلف Qwen3-TTS 1.7B VoiceDesign - . التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.

ما نقطة النهاية التي يجب أن يستخدمها Qwen3-TTS 1.7B VoiceDesign؟

استخدم https://api.tokenlab.sh/v1/audio/speech كافتراضي لـ Qwen3-TTS 1.7B VoiceDesign. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.

ما العمليات التي يدعمها Qwen3-TTS 1.7B VoiceDesign؟

Qwen3-TTS 1.7B VoiceDesign يدعم تحويل النص إلى كلام. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.

مقارنة Qwen3-TTS 1.7B VoiceDesign

المصادر

تمت المراجعة في ٠٢‏/١٠‏/٢٠٢٦

المزيد من Qwen TTS

نماذج ذات صلة