Google تطلق Gemini 3.8 لتوليد أصوات واقعية بأكثر من 100 لغة
أطلقت Google نموذجي Gemini 3.8 Flash TTS وFlash-Lite TTS لتوليد أصوات أكثر تعبيراً، مع إمكانية تصميم أصوات مخصصة وتوجيه الأداء سطراً بسطر وإنشاء حوارات بين متحدثين بأكثر من 100 لغة.
تفاصيل الخبر
كشفت Google عن أحدث نماذجها لتحويل النص إلى كلام، لتوسّع قدرات Gemini في إنشاء الصوت وتمنح المطورين وصناع المحتوى تحكماً أكبر في الشخصيات والأداء الصوتي.
- يأتي Gemini 3.8 Flash TTS مخصصاً للتجارب التي تحتاج إلى تصميم أصوات وشخصيات جديدة، مع إمكانية توجيه الأداء الصوتي باستخدام أوامر باللغة الطبيعية.
- يركز Gemini 3.8 Flash-Lite TTS على الاستخدام واسع النطاق، مثل إنتاج المحتوى الصوتي والترجمة الصوتية والوكلاء الصوتيين، مع التركيز على الكفاءة.
- يمكن إنشاء أصوات جديدة من الصفر عبر تحديد الشخصية واللهجة وخصائص الصوت، مع دعم أكثر من 100 لغة ولهجة.
- توفر Google مكتبة تضم أكثر من 2,000 صوت جاهز للإنتاج، بما في ذلك تنوعات إقليمية متعددة.
- يمكن إعادة إنشاء ملف صوتي متناسق من عينة مدتها 30 ثانية، بشرط امتلاك المستخدم الحق في استخدام الصوت، مع وجود آليات للتحقق من موافقة صاحب الصوت.
- تتيح النماذج توجيه الأداء سطرًا بسطر، بما يشمل السرعة والنبرة والمشاعر وطريقة الإلقاء والإشارات الصوتية.
- تدعم التقنية إنشاء محتوى طويل مثل الكتب الصوتية والبودكاست مع الحفاظ على جودة الصوت واتساق شخصية المتحدث عبر فترات طويلة.
- يمكن إنشاء مشاهد حوارية تضم متحدثين اثنين من نص واحد، مع الحفاظ على تمييز الأصوات وتسلسل الحوار بصورة طبيعية.
- يستطيع المستخدم إضافة مؤثرات وتفاعلات صوتية مثل الضحك والتنهد واللهاث وإشارات الاستماع أثناء المحادثة.
- تتضمن النماذج إجراءات لحماية الاستخدام، إذ تستخدم Google تقنية SynthID لوضع علامة مائية غير مرئية داخل المقاطع الصوتية المولدة بالذكاء الاصطناعي.
وتأتي هذه الخطوة ضمن توسع Google في تقنيات الصوت داخل منظومة Gemini، حيث يمكن استخدام Gemini 3.8 Flash TTS عبر Gemini API وGoogle AI Studio، كما يتوفر للمستخدمين عبر Gemini Notebook، بينما يتوفر Gemini 3.8 Flash-Lite TTS عبر Google AI Studio وGoogle Vids.
كما أعلنت Google عن تعاونها مع منصات وشركات مثل Figma وHeyGen وWondercraft وOllang لدمج النماذج الجديدة في تطبيقات تشمل الدبلجة وتوطين المحتوى وبناء وكلاء صوتيين تفاعليين.
الأهداف المستقبلية
تسعى Google من خلال نماذج Gemini الصوتية الجديدة إلى توسيع استخدام الذكاء الاصطناعي في إنتاج المحتوى والتطبيقات الصوتية التفاعلية، مع الحفاظ على ضوابط مرتبطة بالهوية والموافقة. ومن أبرز الاتجاهات المستقبلية:
- توفير خيارات أكبر لتصميم الأصوات وتخصيص خصائصها.
- توسيع استخدام الصوت المولد بالذكاء الاصطناعي في الألعاب والكتب الصوتية والبودكاست.
- دعم إنتاج الدبلجة متعددة اللغات مع الحفاظ على الخصائص الصوتية واللهجات المحلية.
- تطوير وكلاء صوتيين قادرين على إجراء محادثات أكثر طبيعية وتفاعلاً.
- إتاحة Voice Remixing مستقبلاً لتعديل النبرة وطبقة الصوت والسرعة واللهجة للأصوات الموجودة.
- مواصلة تطوير تقنيات العلامات المائية وآليات الموافقة للمساعدة في حماية أصحاب الأصوات وتعزيز شفافية المحتوى المولد بالذكاء الاصطناعي.
تقدم Gemini 3.8 Flash TTS وFlash-Lite TTS تحولاً في طريقة إنشاء الصوت بالذكاء الاصطناعي، من اختيار أصوات جاهزة إلى تصميم شخصيات صوتية وتوجيه أدائها بالتفصيل. ومع دعم أكثر من 100 لغة ومزايا الحوار متعدد المتحدثين، تستهدف Google استخدامات متنوعة تشمل المحتوى والتعليم والألعاب والدبلجة والوكلاء الصوتيين.
