ديب غرام تطلق Flux TTS لصناعة وكلاء صوتيين أكثر واقعية
أطلقت ديب غرام نموذج Flux TTS الجديد لتحويل النص إلى كلام، والمصمم خصيصاً للوكلاء الصوتيين في الوقت الفعلي، مع استجابة تبدأ خلال 80 مللي ثانية وقدرة أفضل على فهم سياق المحادثة والتعامل مع المقاطعات.

تفاصيل إطلاق Flux TTS
تقدم ديب غرام Flux TTS باعتباره نموذجاً لتحويل النص إلى كلام صُمم للمحادثات الحية، وليس فقط لتحويل نص منفرد إلى ملف صوتي. ويحتفظ النموذج بسياق المحادثة بين الأدوار، ما يساعد الصوت على الحفاظ على نبرة وطريقة كلام متناسقة أثناء التفاعل.
- يمكن أن تبدأ الاستجابة الصوتية خلال 80 مللي ثانية، ما يساعد على تقليل التأخير أثناء المحادثات.
- يتعامل النموذج مع المقاطعات بشكل طبيعي، ويستطيع معرفة ما الذي سمعه المستخدم قبل حدوث المقاطعة، وهو أمر مهم للحفاظ على حالة الوكيل الصوتي.
- يحافظ Flux TTS على السياق بين جولات المحادثة، بحيث يمكن أن تؤثر التفاعلات السابقة في النبرة والإيقاع والأسلوب المستخدم في الردود اللاحقة.
- لا يحتاج النموذج إلى الاعتماد على علامات خاصة مثل SSML أو تعليمات أسلوبية معقدة للتحكم في طريقة إلقاء الكلام.
- صُمم للتعامل بدقة مع المعلومات الحساسة مثل أسماء الأدوية وأرقام الحسابات والتواريخ والعملات والسلاسل الرقمية.
- يوفر خيارات للنشر عبر السحابة أو السحابة الخاصة أو داخل البنية التحتية الخاصة بالشركات.
- يدعم بروتوكول WebSocket مخصصاً للمحادثات الصوتية في الوقت الفعلي، إلى جانب خيارات أخرى لتشغيل النموذج.
وتأتي هذه الخطوة في وقت يتجه فيه تطوير الذكاء الاصطناعي الصوتي من مجرد إنتاج أصوات طبيعية إلى بناء محادثات كاملة يستطيع فيها الوكيل الاستماع والتحدث والتعامل مع المقاطعات دون فترات صمت طويلة أو ردود تبدو آلية.
ما الأهداف المستقبلية لـ Flux TTS؟
تهدف ديب غرام إلى جعل Flux TTS جزءاً من البنية الأساسية للوكلاء الصوتيين الذين يمكنهم التعامل مع المحادثات الواقعية على نطاق واسع. ويبدو أن التركيز الأساسي سيكون على الجمع بين السرعة والطبيعية والاستمرارية بدلاً من تحسين جودة الصوت بمعزل عن تجربة المحادثة.
ومن أبرز الاتجاهات المستقبلية:
- تطوير وكلاء صوتيين أكثر سرعة وطبيعية في التفاعل.
- تقليل الفاصل الزمني بين كلام المستخدم ورد الوكيل.
- تحسين التعامل مع المقاطعات وتغيير مسار المحادثة.
- الحفاظ على نبرة وصوت متناسقين خلال المكالمات الطويلة.
- دعم الشركات التي تستخدم الوكلاء الصوتيين في خدمة العملاء والقطاعات المتخصصة.
- توفير خيارات نشر مرنة تناسب احتياجات الشركات المتعلقة بالأمان والخصوصية.
يمثل Flux TTS خطوة جديدة في تطور الذكاء الاصطناعي الصوتي، إذ تركز ديب غرام على جعل الوكيل يتحدث بطريقة أقرب إلى المحادثة البشرية الحقيقية. ومع زمن استجابة يبدأ من 80 مللي ثانية وقدرات مدمجة لفهم السياق والمقاطعات، قد يصبح النموذج خياراً مهماً للشركات التي تبحث عن وكلاء صوتيين أكثر سرعة وطبيعية.
