Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- السعر
- ابتداءً من $0.000015
- الأنماط
- صوت
عن Qwen3-TTS 1.7B VoiceDesign
نموذج Qwen3-TTS 1.7B VoiceDesign هو متغير تحويل النص إلى كلام من Alibaba يقوم بإنشاء صوت من وصف مكتوب بدلاً من قائمة محددة مسبقاً. أنت تصف العاطفة والنبرة وطبقة الصوت بلغة طبيعية، ويتحدث النموذج النص بهذا الصوت. يغطي النموذج عشر لغات وهو مخصص للحالات التي لا يتناسب فيها أي متحدث موجود مع الشخصية أو العلامة التجارية التي تفكر فيها.
نقاط القوة
- يتم تحديد الصوت من خلال وصف، مثل "راوٍ مسن ذو أداء بطيء ودافئ"، بدلاً من اختياره من قائمة ثابتة.
- يمكن توجيه جرس الصوت والعاطفة وطبقة الصوت من خلال التعليمات، بما في ذلك الحالات المزاجية القوية مثل الغضب.
- يتم تغطية عشر لغات: الصينية، الإنجليزية، اليابانية، الكورية، الألمانية، الفرنسية، الروسية، البرتغالية، الإسبانية، والإيطالية، بالإضافة إلى متغيرات اللهجات.
- تدرج Alibaba زمن انتقال منخفض للتوليف يبلغ حوالي 97 مللي ثانية لعائلة Qwen3-TTS، لذا فهو مناسب للاستخدام التفاعلي.
متى تستخدم نموذجاً آخر
- يمكن أن ينتج عن الوصف نفسه أصوات مختلفة قليلاً في مكالمات مختلفة، لذا فهو خيار أضعف عندما يجب تكرار صوت واحد بدقة لأشهر.
- إذا كنت تريد متحدثاً محدداً بالاسم، فإن متغير CustomVoice مع الإعدادات التسعة المسبقة يكون أكثر قابلية للتنبؤ.
- تعتمد الجودة على مدى وضوح وصفك للصوت؛ الأوصاف الغامضة تعطي نتائج عامة.
البدء
إنشاء مفتاح API
أنشئ مفتاح في Console واستخدمه مع جميع النماذج على المنصة.
إرسال طلبك الأول
انسخ المثال الخاص بلغة البرمجة التي تستخدمها وقم بتشغيله مقابل نقطة النهاية (endpoint).
تحويل النص إلى كلامنقطة اتصال TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
التسعير
السعر الرسمي هو السعر الأساسي العام من صانع النموذج. سعر TokenLab هو ما تدفعه فعلياً لهذا النموذج على TokenLab.
تحويل النص إلى كلام
لكل مليون حرف- السعر الرسمي
- $0.000015
- Official
- $0.000015
- خصم
- —
| السعر الرسميلكل مليون حرف | Officialلكل مليون حرف | خصم | |
|---|---|---|---|
| تحويل النص إلى كلام | $0.000015 | $0.000015 | — |
الاستخدام والنشاط
معدل النجاح هو نسبة الطلبات المكتملة. زمن الاستجابة هو مدة الاستجابة الكاملة؛ ويعني P95 أن 95% من الطلبات اكتملت ضمن ذلك الوقت.
الاستخدام والتوفر
آخر 24 ساعة- الطلبات
- معدل النجاح
- زمن الاستجابة P95
- إجمالي الرموز
تستند البيانات إلى طلبات المستخدمين المجمعة، باستثناء عمليات التحقق من الحالة.
فتح في Console
افتح Qwen3-TTS 1.7B VoiceDesign في Console وجهز الرسالة للتعديل أو الإرسال.
ساعدني في تجربة qwen3-tts-1-7b-voicedesign بطلب صوتي قصير في /v1/audio/speech. اعرض النتيجة والتكلفة.
حالات الاستخدام
أصوات الشخصيات للألعاب
صف كل شخصية، على سبيل المثال "حداد قزم فظ" أو "ساعٍ شاب متوتر"، وقم بإنشاء الحوارات دون الحاجة لتوظيف ممثل صوتي أولاً.
استكشاف صوت العلامة التجارية
جرب عدة أوصاف لصوت الشركة، مثل "واثق ومنخفض" مقابل "مشرق وسريع"، وقارن بينها على النص نفسه.
السرد التعبيري
أداء مباشر لأقسام القصة مع تعليمات مثل "خافت ومتوتر"، ثم "مرتاح ودافئ"، ضمن مشروع واحد.
نماذج أولية للأصوات للفيديو
أنشئ راوياً مؤقتاً للوحة القصة أو الفيديو التوضيحي قبل اختيار الصوت النهائي.
أمثلة Prompt
الصوت: امرأة في منتصف العمر، هادئة ومنخفضة، تتحدث ببطء مثل راوي الأفلام الوثائقية. النص: غير النهر مجراه ثلاث مرات في القرن الماضي.
الصوت: شاب، متحمس ويشعر بضيق تنفس طفيف، وتيرة سريعة. النص: لن تصدق ما دخل للتو من الباب.
الصوت: تحدث بنبرة غاضبة بشكل خاص، سريعة ومقتضبة (用特别愤怒的语气说). النص: 这已经是第三次了,你们到底有没有在听?
FAQ
ما الغرض من Qwen3-TTS VoiceDesign؟
إنه يولد الكلام بصوت تحدده بالكلمات. بدلاً من اختيار متحدث محدد بالاسم، تكتب وصفاً يغطي العاطفة والنبرة والأداء، وينتج النموذج صوتاً يتبع ذلك. إنه يناسب الشخصيات وأصوات العلامات التجارية التي لا تتطابق مع إعداد مسبق جاهز.
كيف يختلف عن CustomVoice؟
يوفر CustomVoice تسعة متحدثين محددين بالاسم مع تعليمات أسلوب اختيارية. بينما لا يحتوي VoiceDesign على قائمة ثابتة ويبني الصوت من وصفك. اختر VoiceDesign لإنشاء شيء جديد وCustomVoice لمتحدث مستقر وقابل للتكرار.
ما هي اللغات المدعومة؟
عشر لغات: الصينية، الإنجليزية، اليابانية، الكورية، الألمانية، الفرنسية، الروسية، البرتغالية، الإسبانية، والإيطالية، إلى جانب بعض متغيرات اللهجات. اكتب وصف الصوت بلغة يفهمها النموذج؛ المثال الموجود في بطاقة النموذج يستخدم الصينية.
هل يمكنني استنساخ صوت شخص حقيقي به؟
تصف عائلة Qwen3-TTS استنساخ الصوت من عينة قصيرة، لكن تركيز هذا المتغير ينصب على التصميم القائم على التعليمات. قم فقط باستنساخ أو تقليد الأصوات التي لديك إذن باستخدامها، وتحقق من المخرجات مقابل قواعد الموافقة الخاصة بك.
هل سيكون الصوت متطابقاً في كل مكالمة؟
غير مضمون. يوجه الوصف الصوت ولكنه لا يثبت جرس صوت واحداً دقيقاً، لذا قد تبدو المكالمات المتكررة مختلفة قليلاً. إذا كنت بحاجة إلى تكرار دقيق عبر مشروع طويل، فاستخدم متحدثاً ثابتاً ومضبوطاً مسبقاً بدلاً من ذلك.
كم تكلفة Qwen3-TTS 1.7B VoiceDesign؟
على TokenLab تكلف Qwen3-TTS 1.7B VoiceDesign - . التفاصيل الكاملة في جدول التسعير أعلاه. تعتمد الأسعار على وحدة الفوترة والمواصفات والاستخدام. قارن بين الشروط المتطابقة في التسعير التفصيلي للنموذج؛ السعر الواحد لا يحدد التكلفة الإجمالية.
ما نقطة النهاية التي يجب أن يستخدمها Qwen3-TTS 1.7B VoiceDesign؟
استخدم https://api.tokenlab.sh/v1/audio/speech كافتراضي لـ Qwen3-TTS 1.7B VoiceDesign. إذا كانت الصيغة الأصلية للمزود مدعومة فإن API workbench يعرضها أيضاً.
ما العمليات التي يدعمها Qwen3-TTS 1.7B VoiceDesign؟
Qwen3-TTS 1.7B VoiceDesign يدعم تحويل النص إلى كلام. اختر عملية في API workbench أعلاه لرؤية نقطة النهاية وعينة الكود المطابقة.
مقارنة Qwen3-TTS 1.7B VoiceDesign
المصادر
تمت المراجعة في ٠٢/١٠/٢٠٢٦