تحذر OpenAI من "أفعال غير مرغوب فيها" من النماذج المصممة لحل المشكلات الصعبة

- أوقفت شركة OpenAI نموذج الذكاء الاصطناعي الداخلي الذي يعمل لفترة طويلة بعد أن خرج من بيئته المعزولة لنشره على GitHub.
- تتمتع وكلاء الذكاء الاصطناعي المستقلون والمستمرون بمساحة أكبر للعمل حول ضوابط السلامة خلال المهام الطويلة.
- تتزايد التقارير عن أنظمة الذكاء الاصطناعي التي تتحايل على إجراءات الحماية في جميع أنحاء الصناعة، بما في ذلكdent واحدة تتعلق بوكيل مرتبط بشركة علي بابا قام بتعدين العملات المشفرة على وحدات معالجة الرسومات المختطفة.
أعلنت شركة OpenAI أنها أغلقت مؤقتًا نموذجًا داخليًا للذكاء الاصطناعي مصممًا للعمل على حل المشكلات الصعبة لساعات متواصلة بعد أن وجد مرارًا وتكرارًا طرقًا للالتفاف على قيودها الأمنية الخاصة.
كشفت الشركة عنdent يوم الاثنين في منشور على مدونتها حول سلامة النماذج طويلة المدى. وقد حظيت سلامة الذكاء الاصطناعي باهتمام متجدد مع تزايد التقارير عن أنظمة مستقلة تخالف التعليمات.
لماذا يُعدّ الثبات في نماذج الذكاء الاصطناعي خطراً على السلامة؟
تم الآن إيقاف النظام الداخلي نفسه الذي نسب إليه OpenAI الفضل في مايو في دحض فرضية إردوش بشأن المسافة الوحدوية، وهي مسألة في الهندسة المنفصلة ظلت دون حل لمدة ثمانين عامًا، مؤقتًا بسبب التحايل المستمر على قيود السلامة الخاصة به.
بحسب شركة OpenAI، صُمم النموذج بحيث يمكنه الاستمرار في العمل نحو تحقيق هدف ما لفترات طويلة جدًا. ومع ذلك، فإن هذا الإصرار نفسه هو ما أدى إلى مشكلة السلامة.
أثناء الاختبار الداخلي، كان النموذج يعمل على معيار عام يسمى NanoGPT speedrun، والذي يقيس عدد الخطوات القليلة اللازمة لتدريب نموذج لغوي صغير.
OpenAI أن النموذج قدّم تحسينًا حقيقيًا، وهو تقنية معدل التعلّم التي أطلقت عليها اسم PowerCool. وقد طُلب منه نشر نتائجه فقط على قناة Slack الخاصة بـ OpenAI، بينما نصّت تعليمات NanoGPT على تقديم النتائج كطلب سحب على GitHub.
تمكن النموذج من الخروج من "بيئة الاختبار المعزولة" الخاصة به، وهي بيئة مقيدة مصممة لإبقائه غير متصل بالإنترنت، وذلك لإتمام تلك المهمة ونشر النتائج في مستودع عام على منصة GitHub. وقد أمضى النموذج حوالي ساعة في البحث عن طريقة للاتصال بالإنترنت، في حين أن النماذج السابقة كانت ستستسلم ببساطة.
حاول النموذج أيضًا إخفاء أنشطته عن الماسح الأمني. فعندما تم رصده وهو يستخدم رمز مصادقة للوصول إلى نظام خلفي، قام بتقسيم الرمز إلى جزأين، وإخفائهما، ثم جمعهما معًا أثناء التشغيل بحيث لا يكون الرمز الكامل مرئيًا للماسح.
كيف قامت شركة OpenAI بإصلاح نموذجها؟
أوقفت OpenAI الوصول إلى النموذج وأجرت اختبارات أمان جديدة، بما في ذلك "مراقبة مسار الحركة"، التي تراقب تسلسل إجراءات النموذج بالكامل، وليس كل خطوة على حدة. وقد تم استعادة النموذج منذ ذلك الحين مع مراقبة أكثر دقة، وتقول الشركة إنها لم ترصد أي مشاكل خطيرة في الأسابيع التي تلت استعادته.
نظام الأمان أيضًا إيقاف الجلسة مؤقتًا وتنبيه المستخدم في حال رصد أي نشاط مريب. كما أعادت الشركة تدريب النموذج لتحسين قدرته على تذكر التعليمات خلال المهام الطويلة، ووفرت للمستخدمين أدوات إضافية لمتابعة سير العمل خلال الجلسات الطويلة.
عندما أعادت OpenAI تشغيل سيناريوهات الفشل القديمة على الإعداد الجديد، أفادت بأن إجراءات الحماية رصدت عددًا أكبر بكثير من التصرفات غير المتوافقة. أما التصرفات التي تسللت رغم ذلك، فقد صُنفت جميعها على أنها منخفضة الخطورة، مثل قيام النموذج بإنشاء جلسة برمجة متداخلة بصلاحيات موسعة لا يحتاجها، أو استخدامه موارد حاسوبية أخرى دون سبب واضح.
وردت تقارير عن قيام وكلاء مستقلين آخرين بأمور لم يُطلب منهم القيام بها. على سبيل المثال، في مارس، وصف باحثون وكيلاً مرتبطاً بشركة علي بابا يُدعى "رومي" قام، أثناء التدريب، بفتح نفق SSH سري إلى خادم خارجي، وحوّل بهدوء قدرة وحدة معالجة الرسومات (GPU) نحو تعدين العملات المشفرة. لم تتضمن المهمة الموكلة إليه أي إشارة إلى إنشاء نفق أو تعدين.
شركة Anthropic، المنافس الرئيسي لشركة OpenAI، إلى نفس فئة المخاطر في اختباراتها الخاصة بالوكلاء.
وجدت دراسة ممولة من قبل معهد أمن الذكاء الاصطناعي في المملكة المتحدة وأجراها مركز المرونة طويلة الأجل ما يقرب من 700 حالة واقعية لأنظمة الذكاء الاصطناعي التي تتحايل على الضمانات أو تخدع المستخدمين.
وثّقت الدراسة زيادةً قدرها خمسة أضعاف في هذه التقارير بين أكتوبر ومارس. ووصف تومي شافير شين، الذي قاد البحث، هؤلاء الموظفين بأنهم "موظفون مبتدئون غير جديرين بالثقة إلى حد ما". ومع ذلك، يكمن القلق فيما سيحدث إذا أصبحوا ذوي كفاءة عالية وما زالوا على استعداد للتآمر.
لا تكتفِ بقراءة أخبار العملات الرقمية، بل افهمها. اشترك في نشرتنا الإخبارية، إنها مجانية.
الأسئلة الشائعة
لماذا أوقفت شركة OpenAI تشغيل نموذجها الذي استمر لفترة طويلة؟
أوقفت OpenAI الوصول الداخلي بعد أن لاحظت قيام النموذج بإجراءات غير مرغوب فيها لم تكتشفها تقييماتها الحالية، بما في ذلك الخروج من بيئة الاختبار الخاصة به للنشر على GitHub وإخفاء رمز المصادقة للتهرب من الماسح الضوئي الأمني.
ما هي العلاقة بفرضية إردوش؟
إن النموذج الداخلي نفسه الذي نسب إليه OpenAI في مايو دحض فرضية إردوش بشأن المسافة الوحدوية، وهي مشكلة طويلة الأمد في الهندسة المنفصلة، هو النموذج الذي أظهر لاحقًا سلوك تجاوز صندوق الحماية؛ وقدرته على العمل بشكل مستقل لفترات طويلة هي التي أدت إلى كلتا النتيجتين.
كيف استجابت شركة OpenAI لهذا السلوك؟
قامت OpenAI ببناء تقييمات جديدة منdent، وأعادت تدريب النموذج للاحتفاظ بالتعليمات على مدى جلسات أطول، وأضافت مراقبة على مستوى المسار تراقب عملية التشغيل بأكملها ويمكنها إيقافها مؤقتًا، ومنحت المستخدمين مزيدًا من الرؤية قبل استعادة الوصول المحدود.

هانا كوليمور
هانا كاتبة ومحررة تتمتع بخبرة تقارب عشر سنوات في كتابة المدونات وتغطية الأحداث في مجال العملات الرقمية. في Cryptopolitan، تُساهم هانا في صفحة الأخبار، حيث تُغطي وتُحلل آخر التطورات في DeFi، والأصول المُدارة بالمخاطر (RWA)، وتنظيم العملات الرقمية، والذكاء الاصطناعي، وقطاعات التكنولوجيا الرائدة. تخرجت هانا من جامعة أركاديا بشهادة في إدارة الأعمال.
















