Meta تطلق Muse Voice Transcribe لتحويل الصوت إلى نص لحظياً
أعلنت Meta عن إطلاق Muse Voice Transcribe، أول نموذج صوتي فوري من مختبر Meta Superintelligence Labs، لتحويل الكلام المباشر إلى نص مع القدرة على التمييز بين أكثر من 20 متحدثاً ودعم اللغات المتعددة.

تفاصيل الخبر
يمثل Muse Voice Transcribe خطوة جديدة في تطوير تقنيات فهم الصوت بالذكاء الاصطناعي، إذ يجمع بين تحويل الكلام إلى نص في الوقت الفعلي، والتعرف على المتحدثين، وتحديد لحظة انتهاء الكلام دون الحاجة إلى معالجة لاحقة.
وتبرز أهم إمكانيات النموذج في النقاط التالية:
- تحويل الصوت إلى نص لحظياً: يعالج النموذج الصوت أثناء الحديث، ما يسمح بظهور النص بسرعة مع تقليل زمن الانتظار.
- تمييز أكثر من 20 متحدثاً: يستطيع تحديد المتحدثين المختلفين داخل المحادثات الجماعية، حتى عندما يتداخل كلامهم.
- دعم أكثر من 25 لغة: جرى التحقق بشكل موسع من أداء النموذج في 25 لغة، مع تدريب النموذج على أكثر من 70 لغة.
- التبديل بين اللغات: يمكن للنموذج فهم الانتقال بين لغتين داخل الجملة نفسها، وهي ميزة مهمة للمحادثات الثنائية اللغة.
- فهم السياق والكلمات المهمة: يستخدم النموذج معلومات اللغة والكلمات المفتاحية والسياق لتحسين دقة التعرف على أسماء الأشخاص والأماكن والمصطلحات.
- دعم المحادثات الطويلة: يمكنه التعامل مع تسجيلات صوتية تتجاوز ساعة واحدة، مع إمكانية تمييز أكثر من 20 متحدثاً.
- تحديد بداية ونهاية الكلام: يساعد النظام على معرفة متى بدأ الشخص الحديث ومتى انتهى، ما يجعله مناسباً للتفاعلات الصوتية الطبيعية.
وبحسب Meta، حقق Muse Voice Transcribe المركز الأول في اختبارات تحويل الكلام المتدفق إلى نص وفي اختبارات تمييز المتحدثين العامة. كما سجل معدل خطأ في الكلمات النهائية بلغ نحو 3.1% في الاختبار المعروض، بينما بلغ معدل خطأ تمييز المتحدثين 17.5%.
كيف يعمل Muse Voice Transcribe؟
يعتمد النموذج على معالجة الصوت في أجزاء صغيرة تبلغ 80 ميلي ثانية، ثم يقرر بشكل ديناميكي ما إذا كان يحتاج إلى الاستماع إلى جزء إضافي من الصوت أو البدء في إخراج النص.
وتستخدم Meta تقنية التأخير التكيفي، بحيث لا ينتظر النموذج المدة نفسها مع كل كلمة. فإذا كانت الكلمة سهلة يمكنه إصدارها بسرعة، بينما قد ينتظر وقتاً أطول عندما يحتاج إلى سياق إضافي لتحسين الدقة.
كما أضافت Meta قدرات خاصة لتمييز انتقال المتحدثين وتحديد نهاية الجمل، وتم تدريب هذه المهام مع تحويل الكلام إلى نص ضمن نظام واحد.
تطبيقات Muse Voice Transcribe
لا يقتصر النموذج على التجارب البحثية، إذ أصبح متاحاً للاستخدام عبر Meta Model API وMeta AI for Mac وMuse Code.
وتفتح هذه القدرات المجال أمام استخدامات متعددة، مثل:
- تفريغ الاجتماعات والمقابلات مباشرة.
- إنشاء نصوص للمحادثات الطويلة مع تحديد هوية كل متحدث.
- تحسين المساعدات الصوتية التي تحتاج إلى فهم المحادثات الطبيعية.
- دعم المستخدمين الذين يتحدثون أكثر من لغة في المحادثة نفسها.
- استخدام الإملاء الصوتي عبر التطبيقات والمهام المختلفة على الكمبيوتر.
- تطوير تجارب صوتية أكثر طبيعية في أدوات Meta AI.
الأهداف المستقبلية
يبدو أن Meta تتعامل مع Muse Voice Transcribe باعتباره أساساً لتطوير أنظمة ذكاء اصطناعي قادرة على الاستماع والفهم في الوقت الفعلي، وليس مجرد أداة لتحويل الصوت إلى نص.
وتشير الشركة إلى إمكانية استخدام هذه التقنية ضمن تجارب المساعدات الشخصية والأجهزة التي تعتمد على التفاعل الصوتي، خصوصاً عندما يحتاج النظام إلى فهم محادثة حقيقية تضم عدة أشخاص ولغات ومقاطعات في الكلام.
كما يمكن أن يصبح تحسين السرعة والدقة وتمييز المتحدثين خطوة مهمة نحو بناء مساعدين صوتيين أكثر قدرة على فهم السياق المحيط بالمستخدم، بدلاً من الاكتفاء بتنفيذ أوامر صوتية قصيرة.
يمثل إطلاق Muse Voice Transcribe إنجازاً مهماً لـMeta في مجال الذكاء الاصطناعي الصوتي، بفضل الجمع بين سرعة تحويل الكلام إلى نص، وتمييز المتحدثين، ودعم اللغات والتبديل بينها، والتعامل مع المحادثات الطويلة. ومع توفره عبر أدوات Meta المختلفة، قد تتحول هذه التقنية إلى جزء أساسي من مستقبل التفاعل الصوتي مع الذكاء الاصطناعي.
