Google تطلق Gemini 3.8 Live لمحادثات صوتية أكثر ذكاء وتطور

أطلقت Google نموذجي Gemini 3.8 Live وGemini 3.8 Live Extended Thinking لتعزيز المحادثات الصوتية بالذكاء الاصطناعي، مع قدرة جديدة على التفكير وتنفيذ المهام المعقدة بالتزامن مع استمرار الحوار.

تفاصيل إطلاق Gemini 3.8 Live

كشفت Google عن أحدث نماذجها للمحادثات الصوتية، Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، بهدف جعل التفاعل مع الذكاء الاصطناعي أكثر سلاسة وفهمًا للسياق، مع تحسين قدرات التفكير وتنفيذ المهام في الوقت الفعلي.

  • 3.8 Live: نموذج مصمم للتوسع والكفاءة من حيث التكلفة، مع دعم المحادثات الطبيعية والاستفادة من المدخلات المرئية لفهم السياق المحيط بالمستخدم.
  • Gemini 3.8 Live Extended Thinking: إصدار مخصص للمهام الأكثر تعقيدًا، ويمكنه التفكير والتحدث في الوقت نفسه دون إيقاف المحادثة.
  • تفكير أثناء التحدث: يستطيع النموذج تقديم إشارات صوتية مبكرة مثل “Let me check that…” أثناء معالجة الطلب، بدلًا من ترك المستخدم في حالة انتظار صامتة.
  • دعم 97 لغة: يمكن للنموذج اكتشاف اللغات المدعومة والانتقال بينها أثناء المحادثة.
  • فهم المدخلات المرئية: يعالج Gemini 3.8 Live الصور والمعلومات المرئية في وقت قريب من الوقت الفعلي، ما يسمح باستخدامه في مواقف مثل المساعدة التقنية وتحليل لوحة الشطرنج.
  • تنفيذ المهام في الخلفية: يمكن للنموذج إجراء استدعاءات الأدوات وواجهات API أثناء استمرار الحوار، بحيث يواصل المستخدم الحديث بينما تُنفذ المهمة.
  • أداء في اختبارات الصوت: ذكرت Google أن إصدار Extended Thinking حصل على نتيجة 82.6 في مؤشر جودة تحويل الكلام إلى كلام من Artificial Analysis، إلى جانب نتائج مرتفعة في بعض اختبارات إكمال المهام الصوتية.
  • استخدامات عملية: يمكن توظيف النماذج في وكلاء صوتيين لخدمة العملاء، وإنجاز الحجوزات، وإعداد المستندات، والمساعدة في عمليات العمل متعددة الخطوات.
  • التكامل مع خدمات Google: تتوسع التجربة لتشمل Gemini Live وSearch Live، إضافة إلى تطبيقات Google Workspace مثل Docs وGmail وKeep للمشتركين المؤهلين.
  • حماية المحتوى الصوتي: تقول Google إن الصوت الناتج عن منتجاتها المدعومة بالذكاء الاصطناعي يحمل علامة مائية غير محسوسة عبر تقنية SynthID للمساعدة في اكتشاف المحتوى المُنشأ بالذكاء الاصطناعي.

الأهداف المستقبلية لـ Gemini 3.8 Live

تسعى Google من خلال النماذج الجديدة إلى توسيع استخدام المحادثات الصوتية من مجرد الإجابة عن الأسئلة إلى تنفيذ مهام معقدة بصورة تفاعلية، وتشمل أبرز الاتجاهات المستقبلية:

  • تطوير وكلاء صوتيين قادرين على تنفيذ مهام متعددة الخطوات.
  • تحسين التعاون بين المستخدم والذكاء الاصطناعي أثناء إنجاز المهام.
  • دعم المطورين في بناء تطبيقات وواجهات صوتية أكثر استجابة.
  • توسيع استخدام النماذج داخل بيئات العمل وخدمات العملاء.
  • تعزيز قدرات الذكاء الاصطناعي على الجمع بين الصوت والرؤية والأدوات الخارجية في الوقت نفسه.
  • إتاحة تجارب صوتية أكثر طبيعية عبر خدمات Google المختلفة.

وبدأت Google طرح Gemini 3.8 Live وGemini 3.8 Live Extended Thinking للمطورين عبر Gemini API وGoogle AI Studio، بينما تتوفر بعض التجارب للمستخدمين من خلال Search Live وGemini Live وخدمات Workspace وفق الخطط المؤهلة.

يمثل إطلاق Gemini 3.8 Live خطوة جديدة نحو جعل المحادثة مع الذكاء الاصطناعي أقرب إلى التفاعل الطبيعي، خصوصًا مع الجمع بين التفكير الفوري، وفهم السياق المرئي، وتنفيذ المهام في الخلفية دون تعطيل الحوار.

مقالات مشابهة