اختراق يكشف مصادر تدريب Suno على ملايين الأغاني المحمية
كشف اختراق أمني استهدف منصة Suno لتوليد الموسيقى بالذكاء الاصطناعي عن شيفرات مصدرية وبيانات داخلية تشير إلى اعتماد الشركة على جمع ملايين المقاطع الموسيقية وكلمات الأغاني من منصات متعددة لتدريب نماذجها، مما أعاد الجدل حول حقوق الملكية الفكرية.

تفاصيل الخبر
تعرضت شركة Suno، المتخصصة في تطوير أدوات توليد الموسيقى بالذكاء الاصطناعي، لاختراق أمني أدى إلى تسريب أجزاء من الشيفرة المصدرية وبيانات داخلية حصل عليها موقع 404 Media. وتكشف الوثائق المسربة تفاصيل غير مسبوقة حول مصادر البيانات التي استخدمتها الشركة لتدريب نماذجها.
وبحسب المعلومات المسربة، اعتمدت Suno على جمع كميات ضخمة من المحتوى الموسيقي من عدد من المنصات والخدمات الشهيرة، وهو ما يدعم الاتهامات التي سبق أن وجهتها شركات صناعة الموسيقى بشأن استخدام أعمال محمية بحقوق النشر في تدريب نماذج الذكاء الاصطناعي.
ومن أبرز ما كشفته التسريبات:
- تضمنت الشيفرة المصدرية تعليمات لجمع المحتوى من YouTube Music وDeezer وGenius.
- شملت مصادر التدريب أيضًا مكتبات موسيقية مثل Pond5 وJamendo وFreesound وInternational Music Score Library Project (IMSLP).
- أشارت الملفات إلى استخدام ملفات RSS لجمع محتوى من برامج البودكاست.
- تضمنت إحدى الملفات إشارة إلى جمع أكثر من 2 مليون مقطع موسيقي من YouTube Music.
- أظهرت بيانات أخرى أن مجموعات التدريب احتوت على عشرات الآلاف من الساعات من المحتوى الموسيقي القادم من مصادر مختلفة.
- أوضحت التعليقات داخل الشيفرة أن النظام كان يقوم بتصفية المحتوى غير الموسيقي قبل استخدامه في التدريب.
- أفاد المخترق أيضًا بأنه تمكن من الوصول إلى بيانات تخص مئات الآلاف من مستخدمي Suno، بالإضافة إلى معلومات مرتبطة بعمليات الدفع عبر Stripe، إلا أن الشركة لم تؤكد هذه المزاعم حتى الآن.
وتأتي هذه التسريبات في وقت تواجه فيه Suno دعاوى قضائية من شركات التسجيل الموسيقي، التي تتهمها باستخدام ملايين الأعمال المحمية بحقوق النشر دون الحصول على تراخيص. وكانت الشركة قد أقرت سابقًا بأنها دربت نماذجها على “معظم الملفات الموسيقية ذات الجودة المناسبة والمتاحة على الإنترنت المفتوح”، مؤكدة في المقابل أن هذا الاستخدام يندرج ضمن مبدأ الاستخدام العادل (Fair Use)، وهو ما لا يزال محل نزاع قانوني.
وتمنح هذه الوثائق المسربة نظرة نادرة على كيفية بناء قواعد البيانات المستخدمة في تدريب نماذج الذكاء الاصطناعي، وهو جانب عادة ما تحرص الشركات على إبقائه سريًا.
الأهداف المستقبلية
قد يكون لهذا الاختراق تأثير كبير على مستقبل صناعة الذكاء الاصطناعي التوليدي، خاصة في المجالات الإبداعية التي تعتمد على محتوى محمي بحقوق الملكية الفكرية.
ومن المتوقع أن تشهد المرحلة المقبلة:
- زيادة التدقيق القانوني في مصادر بيانات تدريب نماذج الذكاء الاصطناعي.
- مطالبة الشركات بمزيد من الشفافية حول آليات جمع البيانات.
- تعزيز إجراءات الأمن السيبراني لحماية الشيفرات المصدرية والبيانات الحساسة.
- استمرار النزاعات القضائية المتعلقة باستخدام المحتوى المحمي بحقوق النشر.
- تطوير سياسات جديدة توازن بين الابتكار في الذكاء الاصطناعي وحماية حقوق أصحاب المحتوى.
كما قد تدفع هذه القضية شركات الذكاء الاصطناعي إلى إعادة تقييم سياسات جمع البيانات، خاصة مع تزايد الضغوط التنظيمية والقانونية في الولايات المتحدة وأوروبا.
تكشف التسريبات المنسوبة إلى Suno حجم التحديات التي تواجه شركات الذكاء الاصطناعي عند تدريب نماذجها على محتوى متاح عبر الإنترنت. وبينما لم تؤكد الشركة جميع الادعاءات الواردة في التسريب، فإن القضية تعيد إلى الواجهة النقاش حول حدود استخدام البيانات المحمية، والشفافية، وأمن المعلومات في عصر الذكاء الاصطناعي.
