Microsoft

Microsoft تطلق نماذج صوتية جديدة للمحادثات الفورية

أعلنت Microsoft عن إطلاق ثلاثة نماذج جديدة للذكاء الاصطناعي الصوتي، تشمل MAI-Transcribe-2-Streaming لتحويل الكلام إلى نص لحظيًا، إلى جانب MAI-Voice-2.1 ونسخته الأسرع Flash لإنشاء أصوات طبيعية ومتعددة اللغات.

تفاصيل الخبر

كشفت Microsoft عن نماذجها الجديدة بهدف تحسين سرعة ودقة تجارب المحادثة الصوتية، خصوصًا التطبيقات التي تحتاج إلى الاستماع والفهم والرد في الوقت الفعلي.

  • MAI-Transcribe-2-Streaming: أول نموذج من Microsoft للنسخ الصوتي المباشر، ويدعم 60 لغة مع اكتشاف تلقائي ومستمر للغة أثناء الحديث.
  • حصل النموذج على المركز الأول في الدقة للنسخ النهائي والجزئي وفق تقييمات Artificial Analysis.
  • يستطيع النموذج تقديم أول توقعات للنص بعد ما يزيد قليلًا على 100 مللي ثانية من استقبال الصوت، ثم تحديثها مع وصول المزيد من الكلام.
  • تقول Microsoft إن الكلمات تظهر في النسخ المباشر بسرعة تصل إلى ضعف سرعة أقرب منافس وفق اختبارات داخلية، ما يجعله مناسبًا للإملاء الفوري والترجمة النصية والتطبيقات الصوتية.
  • يبلغ السعر التمهيدي لـ MAI-Transcribe-2-Streaming نحو 0.54 دولار لكل ساعة صوت حتى نهاية عام 2026.
  • MAI-Voice-2.1: نموذج تحويل النص إلى كلام، ويدعم 23 لغة و26 منطقة محلية، مع إمكانية استخدام الصوت نفسه عبر اللغات مع الحفاظ على نطق ولهجة طبيعية لكل لغة.
  • يبلغ سعر MAI-Voice-2.1 نحو 22 دولارًا لكل مليون حرف.
  • MAI-Voice-2.1-Flash: إصدار أسرع ومخصص للاستخدامات ذات الحجم الكبير والحساسة للوقت، مع استدلال أسرع بنسبة 55% وسعر يصل إلى 15 دولارًا لكل مليون حرف.
  • يستطيع إصدار Flash إنتاج 45 ثانية من الصوت بزمن استجابة إجمالي يبلغ نحو 150 مللي ثانية.
  • يدعم النموذجان الصوتيان استنساخ الأصوات باستخدام بضع ثوانٍ فقط من الصوت المرجعي، مع وجود ضوابط للموافقة تهدف إلى الحد من إساءة الاستخدام.

الأهداف المستقبلية

تركز Microsoft على دمج هذه النماذج لبناء وكلاء صوتيين قادرين على الاستماع والفهم واتخاذ الإجراءات والرد بسرعة قريبة من المحادثة البشرية.

  • تطوير وكلاء خدمة عملاء يمكنهم فهم طلب المتصل والبدء في تنفيذ الإجراءات قبل انتهاء حديثه.
  • إنشاء مساعدين متعددي اللغات يستطيعون اكتشاف اللغة تلقائيًا والرد بالصوت نفسه مع نطق طبيعي.
  • دعم تطبيقات التعليم التفاعلي والمحاكاة والتمثيل الصوتي والمحتوى الإعلامي متعدد اللغات.
  • منح وكلاء الذكاء الاصطناعي وقتًا أكبر للتفكير واستخدام الأدوات، بفضل تقليل زمن الاستجابة في مرحلتي الاستماع والتحدث.
  • دمج نماذج MAI المختلفة لبناء تجارب صوتية أكثر سلاسة، بدل التعامل مع تحويل الكلام إلى نص وتوليد الصوت كعمليتين منفصلتين.

تسعى Microsoft من خلال MAI-Transcribe-2-Streaming وMAI-Voice-2.1 وMAI-Voice-2.1-Flash إلى جعل المحادثات الصوتية بالذكاء الاصطناعي أسرع وأكثر طبيعية، مع دعم واسع للغات وخيارات منخفضة التكلفة نسبيًا. ويمنح الجمع بين النسخ الفوري وتوليد الصوت السريع المطورين أساسًا لبناء وكلاء صوتيين قادرين على التفاعل لحظيًا في خدمة العملاء والتعليم والمساعدات الرقمية.

مقالات مشابهة