xAI تطلق Grok Voice Think Fast 2.0 بسرعة استجابة قياسية
أعلنت xAI عن إطلاق Grok Voice Think Fast 2.0، أحدث نموذج صوتي يعتمد على تقنية التحويل من صوت إلى صوت، مع تحسينات كبيرة في الذكاء، ودقة التفريغ الصوتي، وسرعة الاستجابة التي تصل إلى 0.7 ثانية فقط.

تفاصيل الخبر
كشفت xAI عن الإصدار الجديد Grok Voice Think Fast 2.0، الذي يمثل الجيل الأحدث من نماذج المحادثة الصوتية المباشرة. ويتميز النموذج بقدرته على التفكير أثناء التحدث، مما يتيح إجراء محادثات طبيعية مع الحفاظ على سرعة الاستجابة وجودة الإجابات.
وأوضحت الشركة أن نموذج Grok Voice Think Fast 2.0 الجديد حقق نتائج متقدمة في عدة اختبارات مستقلة، متفوقاً على عدد من أبرز المنافسين في جودة المحادثة، والاستدلال الصوتي، وكفاءة استخدام الأدوات، مع تقليل زمن بدء الرد الصوتي إلى 0.70 ثانية فقط.
ومن أبرز ما جاء في الإعلان:
- تحقيق 82.9% في مؤشر جودة المحادثة الصوتية (AA Speech-to-Speech Quality Index).
- الوصول إلى 97.2% في اختبار الاستدلال الصوتي Big Bench Audio.
- تسجيل 95.1% في اختبار ديناميكيات المحادثة Full Duplex Bench.
- تحقيق 56.5% في اختبار أداء الوكلاء الذكيين τ-voice Bench.
- تقليل زمن بدء الرد الصوتي إلى 0.70 ثانية مقارنة بـ1.25 ثانية في الإصدار السابق.
كما ركزت xAI على تحسين دقة تحويل الصوت إلى نص، حيث أكدت أن Grok Voice Think Fast 2.0 يتفوق على نماذج متخصصة في التفريغ الصوتي مثل Deepgram Nova 3 وElevenLabs Scribe v2، محققاً تحسناً يتراوح بين 1.5 و2 مرة في دقة التعرف على الكلام عبر 24 لغة مختلفة.
وأشارت الشركة إلى أن الفارق يصبح أكبر في البيئات المليئة بالضوضاء، إذ يوفر النموذج أداءً يصل إلى 10 أضعاف مقارنة ببعض الأنظمة المتخصصة، بفضل تدريبه على التعامل مع الضجيج وضغط الصوت المستخدم في المكالمات الهاتفية.
ومن التحسينات اللافتة أيضاً أن Grok Voice Think Fast 2.0 أصبح أكثر كفاءة في استخدام عمليات الاستدلال الداخلي، حيث يستهلك نحو 40% فقط من عدد رموز التفكير التي كان يستخدمها الإصدار السابق، مما يسمح بتنفيذ الأوامر واستدعاء الأدوات بسرعة أكبر، وغالباً قبل انتهاء الجملة الأولى التي ينطق بها المساعد.
وأكدت xAI أنها اعتمدت على التعلم المعزز لتطوير أسلوب الحوار، ليصبح النموذج أكثر طبيعية من خلال استخدام جمل أقصر، وطرح سؤال واحد في كل مرة، وتقليل العبارات غير الضرورية، ما يجعل المحادثة أكثر سلاسة حتى أثناء تنفيذ مهام معقدة.
كما أعلنت الشركة أن الإصدار الجديد سيحل محل grok-voice-latest تلقائياً اعتباراً من 5 أغسطس 2026، دون الحاجة إلى أي تعديل من المطورين، بينما يمكن للراغبين الاستمرار في استخدام الإصدار السابق عبر تثبيت اسم النموذج القديم.
أما من ناحية التكلفة، فقد حددت xAI سعر استخدام Grok Voice Think Fast 2.0 عند 0.08 دولار لكل دقيقة صوتية، مع الإشارة إلى أن اختبارات الشركة الداخلية على خدمة Starlink أظهرت تحسناً في معدلات تحويل المبيعات واحتواء طلبات الدعم الفني.
الأهداف المستقبلية
تسعى xAI من خلال Grok Voice Think Fast 2.0 إلى تعزيز قدرات المساعدات الصوتية المعتمدة على الذكاء الاصطناعي وتقديم تجربة أكثر سرعة وواقعية.
وتشمل أبرز الأهداف:
- تحسين جودة المحادثات الصوتية المباشرة.
- تقليل زمن الاستجابة إلى أقل مستوى ممكن.
- رفع دقة التعرف على الكلام في البيئات الصعبة.
- دعم تطبيقات الوكلاء الذكيين القادرة على تنفيذ المهام تلقائياً.
- تحسين كفاءة استخدام الأدوات أثناء المحادثة.
- توفير نموذج جاهز للاستخدام في مراكز الاتصال وخدمات العملاء.
- تسهيل انتقال المطورين إلى الإصدار الجديد دون الحاجة إلى تعديل التطبيقات.
وتعكس هذه الخطوة تركيز xAI على تطوير نماذج صوتية تجمع بين السرعة، والقدرة على التفكير، والتفاعل الطبيعي، بما يدعم الاستخدامات التجارية وتطبيقات الذكاء الاصطناعي التفاعلية.
يمثل Grok Voice Think Fast 2.0 خطوة جديدة في سباق تطوير نماذج الذكاء الاصطناعي الصوتية، حيث يجمع بين سرعة الاستجابة، ودقة التعرف على الكلام، وقدرات الاستدلال أثناء التحدث، مما يجعله من أبرز النماذج المنافسة في هذا المجال.
