OpenAI

OpenAI تحبط حملة لاستخراج الاستدلال المحمي من نماذجها

أعلنت OpenAI إحباط حملة منسّقة هدفت إلى استخراج الاستدلال المحمي من نماذجها واستخدامه لمحاكاة قدراتها، مشيرةً إلى أن النشاط شمل أكثر من 15 ألف مستخدم، وأن مجموعة أساسية منه ارتبطت بأفراد من شركة Moonshot AI الصينية.

تفاصيل الخبر

كشفت OpenAI عن حملة واسعة النطاق اعتمدت على أساليب مبتكرة لمحاولة استخراج المعلومات الداخلية من نماذج الذكاء الاصطناعي، في ما وصفته بأنه تقطير عدائي.

  • بدأ النشاط الذي رصدته OpenAI في الأسبوع الأول من يوليو 2026، قبل أن يتوسع بشكل ملحوظ.
  • في يومي 24 و25 يوليو، رصدت الشركة أكثر من 16 ألف طلب من أكثر من 4 آلاف مستخدم باستخدام أحد أنماط الاستخراج.
  • كشفت التحقيقات اللاحقة عن نشاط مشابه ضمن مجموعة تجاوزت 15 ألف مستخدم، وتم إيقاف النشاط بالكامل بحلول 28 يوليو.
  • حاول المشاركون استخراج الاستدلال المحمي، وهو السجل الداخلي للخطوات التي يستخدمها النموذج للوصول إلى النتيجة.
  • من الأساليب التي رصدتها OpenAI نسخ استدلال مشفّر من محادثة، ثم استخدام محادثة أخرى لطلب فك تشفيره وإظهاره كنص.
  • أكدت الشركة أن المهاجمين لم يخترقوا أنظمة التشفير أو قواعد البيانات، ولم يصلوا مباشرةً إلى محادثات المستخدمين المخزنة.
  • بحسب تقييم OpenAI، ليس من المؤكد أن جميع المشاركين كانوا تابعين لجهة واحدة، لكنها نسبت مجموعة أساسية من النشاط إلى أفراد مرتبطين بـ Moonshot AI، الشركة المطورة لنموذج Kimi.
  • قالت OpenAI إن باحثين أمنيين مستقلين ساعدوا في الكشف عن ثغرات مرتبطة بأساليب تكثيف السياق، ما ساهم في فهم نطاق الهجمات وتطوير وسائل الحماية.

لماذا يمثل التقطير العدائي خطرًا؟

يُشير التقطير العدائي إلى استخدام مخرجات نموذج ذكاء اصطناعي بطريقة منهجية وغير مصرح بها بهدف تدريب نموذج آخر أو تحسينه أو محاكاة قدراته.

وتكمن الخطورة في أن استخراج الاستدلال الداخلي قد يمنح جهات أخرى معلومات أكثر تفصيلًا من الإجابة النهائية التي يحصل عليها المستخدم، ما قد يساعد على تقليد بعض قدرات النموذج الأصلي دون الاستثمار نفسه في تطويره أو في أنظمة السلامة المرتبطة به.

وترى OpenAI أن المشكلة لا تقتصر على نماذجها، خصوصًا مع تطور تقنيات الذكاء الاصطناعي وظهور نماذج قادرة على التعامل مع مهام أكثر تعقيدًا واستخدامات مزدوجة.

كيف استجابت OpenAI؟

اتخذت الشركة مجموعة من الإجراءات لاحتواء الحملة وتقليل احتمالية تكرارها، شملت:

  • حظر أو تقييد الحسابات المرتبطة بالنشاط المخالف.
  • تعزيز ضوابط التسجيل والبنية التحتية ومراقبة الشبكات ذات الصلة.
  • تقوية حماية الاستدلال المحمي على مستوى المستخدمين ومساحات العمل والمؤسسات.
  • إغلاق مسار كان يسمح بإعادة تمرير استدلال مشفّر واسترجاع محتواه في ظروف معينة.
  • إضافة فحوص لرصد المخرجات التي قد تكشف الاستدلال الداخلي وإيقافها مؤقتًا.
  • التعاون مع مقدمي الخدمات الخارجيين لتعطيل الحسابات المرتبطة بالنشاط عند انتقاله إلى خدمات أخرى.
  • مشاركة المعلومات مع مطوري نماذج الذكاء الاصطناعي الرائدة والجهات الحكومية المناسبة لتعزيز الدفاعات المشتركة.

الأهداف المستقبلية

تتوقع OpenAI أن تصبح محاولات التقطير العدائي أكثر تطورًا مع تحسن النماذج، ولذلك تركز خططها المقبلة على:

  • تعزيز الحماية التقنية ضد محاولات استخراج الاستدلال والمعلومات الداخلية.
  • تحسين قدرة الأنظمة على رصد الحملات المنسقة بدل التعامل مع الحسابات المخالفة بشكل منفرد.
  • توسيع نطاق المصنّفات وآليات اكتشاف الطلبات التي تهدف إلى استخراج المعلومات المحمية.
  • تطوير وسائل حماية إضافية للنماذج التي تستخدم الأدوات أو تتعامل مع مخرجات قابلة لإعادة الاستخدام.
  • ضمان تطبيق مستويات الحماية نفسها عند تشغيل النماذج عبر الخدمات السحابية والشركاء الخارجيين.
  • زيادة تبادل معلومات التهديدات بين شركات الذكاء الاصطناعي والجهات الحكومية.

تكشف حملة التقطير التي أعلنت عنها OpenAI عن جانب جديد من سباق الذكاء الاصطناعي، حيث لا تقتصر محاولات تقليد النماذج على دراسة إجاباتها، بل تمتد إلى البحث عن طرق لاستخراج استدلالها المحمي. ورغم أن OpenAI أوقفت النشاط وعززت دفاعاتها، فإن الشركة تتوقع استمرار هذه المحاولات وتطورها، ما يجعل التعاون بين مطوري النماذج وشركات التقنية والجهات الحكومية عنصرًا مهمًا في حماية القدرات المتقدمة للذكاء الاصطناعي.

مقالات مشابهة