MiniMax تطلق H3 لتوليد وتحرير فيديوهات 2K بالذكاء الاصطناعي
أعلنت شركة MiniMax الصينية عن إطلاق نموذج H3 الجديد، وهو نموذج متعدد الوسائط مفتوح الأوزان قادر على إنشاء وتحرير مقاطع فيديو بدقة 2K مع صوت ستيريو مدمج، اعتمادًا على النصوص أو الصور أو الفيديوهات أو المقاطع الصوتية، في خطوة تعزز المنافسة في سوق توليد المحتوى بالذكاء الاصطناعي.

تفاصيل الخبر
كشفت MiniMax عن نموذج H3 باعتباره نموذجًا عامًا متعدد الوسائط يجمع بين فهم النصوص والصور والفيديو والصوت داخل نموذج واحد. ويستطيع النموذج إنشاء مقاطع فيديو تصل مدتها إلى 15 ثانية بدقة 2K مع صوت ستيريو أصلي، بالإضافة إلى تنفيذ عمليات تحرير معقدة اعتمادًا على أوامر مكتوبة بلغة طبيعية.
وأوضحت الشركة أن H3 يستهدف الاستخدامات التجارية في مجالات الإعلان، والتجارة الإلكترونية، وتصميم المنتجات، والألعاب، وتجربة المستخدم، مع التركيز على تقديم جودة مرتفعة وتكلفة أقل مقارنة بالعديد من النماذج المنافسة.
ومن أبرز مزايا النموذج:
- إنشاء فيديوهات بدقة 2K لمدة تصل إلى 15 ثانية.
- إنتاج صوت ستيريو مدمج دون الحاجة إلى أدوات خارجية.
- دعم الإدخال عبر النصوص والصور والفيديو والملفات الصوتية.
- تنفيذ عمليات تحرير متعددة الوسائط باستخدام أوامر باللغة الطبيعية.
- تحسين دقة عرض النصوص والشعارات داخل الفيديوهات.
- دعم نقل الحركة من فيديو إلى آخر بدقة عالية.
- استهداف الاستخدامات التجارية مثل الإعلانات، والتسويق، والتجارة الإلكترونية، وتصميم واجهات المستخدم.
كما أعلنت MiniMax أنها تعتزم إتاحة أوزان النموذج (Open Weights) خلال الأيام المقبلة، وفقًا للقوانين واللوائح المعمول بها، بهدف دعم مجتمع المصادر المفتوحة، وتسهيل تشغيل النموذج على أنواع مختلفة من العتاد الحاسوبي، وتمكين المطورين من إنشاء نسخ مخصصة تناسب احتياجاتهم.
ويعتمد H3 على مجموعة من التقنيات الجديدة، مثل Contextual Omni Representation وH3-Omni Transformer وH3-VAE، والتي تتيح فهم العلاقات بين مختلف أنواع البيانات داخل السياق نفسه، مما يمنح النموذج قدرة أكبر على تنفيذ التعليمات المعقدة وإنشاء محتوى أكثر دقة وتناسقًا.
الأهداف المستقبلية
أكدت MiniMax أن H3 يمثل بداية مرحلة جديدة في تطوير نماذج الذكاء الاصطناعي متعددة الوسائط، مع خطط لمواصلة تحسين قدراته خلال الإصدارات القادمة. وتشمل أبرز الأهداف المستقبلية:
- دمج قدرات فهم متعددة الوسائط بشكل أعمق.
- زيادة حجم النموذج لتحسين الأداء وجودة النتائج.
- دعم دقات أعلى وجودة بصرية أكثر واقعية.
- تطوير قدرات تحرير الفيديو والصوت داخل نموذج موحد.
- تعزيز دعم المصادر المفتوحة وإتاحة النموذج لمزيد من المطورين.
- توسيع استخدام النموذج في قطاعات الإعلام، والتصميم، والتسويق، وصناعة الألعاب.
وترى الشركة أن مستقبل الذكاء الاصطناعي متعدد الوسائط يعتمد على دمج اللغة والصورة والفيديو والصوت داخل نظام واحد قادر على فهم نية المستخدم وتنفيذها، بحيث يصبح الذكاء الاصطناعي شريكًا فعليًا في إنتاج المحتوى، وليس مجرد أداة لإنشاء مقاطع فيديو قصيرة.
يمثل إطلاق MiniMax H3 خطوة مهمة في سباق تطوير نماذج الفيديو بالذكاء الاصطناعي، خاصة مع توجه الشركة إلى إتاحة أوزان النموذج للمطورين. وإذا نجح H3 في تقديم الأداء الذي وعدت به MiniMax، فقد يصبح أحد أبرز المنافسين في سوق إنشاء الفيديوهات الاحترافية بالذكاء الاصطناعي.
