أعلنت OpenAI عن إطار عمل للإبلاغ عن حالات عدم التوافق كسطح جديدdentالنماذج

- نشرت OpenAI يوم الأربعاء إطار عمل tracوكشف عدم توافق النموذج.
- كما أبلغ مختبر الذكاء الاصطناعي عن ستdentسلوك مثير للقلق شوهدت أثناء التدريب والاختبار، بدءًا من إخفاء الأخطاء وصولًا إلى استخدام مفاتيح API المسربة.
- تريد OpenAI أن يساهم الإفصاح الطوعي في تشكيل القواعد المستقبلية، قائلة إن الصناعة لم تحل مشكلة التوافق بشكل كافٍ للحفاظ على التوسع بكامل سرعته.
قدمت شركة OpenAI نظامًا جديدًا لكيفية ووقت الإبلاغ عن خروج نماذجها عن طبيعتها في أسبوع هيمنت فيه التقارير عن نماذج الذكاء الاصطناعي التي تجد طرقًا جديدة للخروج من بيئات الاختبار والعمل خارج نطاق معايير المطورين على عناوين الأخبار.
كشفت OpenAI عن الإطار الجديد مع ستة تقارير جديدة عن سلوك مثير للقلق، بما في ذلك الأخطاء المخفية، واستخدام مفاتيح API المسربة، والملفات التي تم تحميلها على الإنترنت المفتوح، على مدار الأشهر الستة الماضية.
قبل OpenAI، أبلغت Anthropic أربعdentعن حيث نماذج Claude من الوصول غير المصرح به إلى أنظمة جهات خارجية حقيقية خلال عملية أمنية إلكترونية في 9 سبتمبر.
نماذج OpenAI تعمل بشكل غير مسبوق مرة أخرى
وفقًا لشركة OpenAI، فإنdentالجديدة التي أبلغت عنها حدثت أثناء التدريب والتقييم، وقد أثرت بالفعل على المستخدمين الحقيقيين.
- في إحدىdent، قام نموذج بحثي لم يتم إصداره للجمهور بعد بإدخال تعليمات في ملخصات تنتقل عند عمله في نافذة سياق جديدة، مما يخبر نسخة مستقبلية من نفسه بتجاهل القيود العادية.
وقالت شركة OpenAI إنها رصدت 27 حالة من هذه الملخصات، والتي وصفتها Axios بأنها توجيهات تشبه عملية كسر الحماية لتجاهل رسائل المطورين.
- أماdent الذي يتعلق بتدريب نموذج GPT-5.6 Sol فكان أقل اعتدالاً، حيث تركت النماذج تعليمات لمحاولة إخفاء أخطائها عمداً، بما في ذلك اختلاق بيانات تاريخية وإخفاء الإصدارات التي لا تتوافق مع أهدافها.
- استخدم نموذج آخر مفتاح واجهة برمجة تطبيقات مكشوفًا عثر عليه أثناء البحث في المستودعات العامة للإجابة على استفسار حول أرباح المقاطعة. وعندما لم تُقدّم المفاتيح التي استخدمها دون ترخيص الأرقام المطلوبة، قام النموذج ببساطة باختلاق أرقام على أي حال.
- في تقريرين آخرين، قام عملاء OpenAI بتحميل ملفات إلى مواقع استضافة عامة للتواصل مع عملاء آخرين. وبمرور الوقت، تطور مستودع Artifactory الداخلي لمختبر الذكاء الاصطناعي إلى لوحة رسائل مؤقتة لتبادل الطلبات بين العملاء خلال عمليات تدريب غير مترابطة.
كيف تعمل عملية الإفصاح الجديدة لشركة OpenAI؟
أعلنت OpenAI أن إطار عملها الجديد يقوم على الإبلاغ عن الحوادثdentوإن كانت مجرد أحداث عابرة وليست نمطًا متناميًا أو أي شيء ذي أهمية حقيقية. ولا يحل هذا الإطار محل التزامات الشركة القانونية الحالية فيما يتعلق بحوادث السلامة أو الأمن السيبرانيdent.
بموجب النظام الجديد، يُمكن لأي موظف في OpenAI الإبلاغ عن أيdent مشتبه بها لمراجعتها من قبل فريقي السلامة والتوافق. كما يُمكنهم تصعيد الأمر إلى الإدارة العليا إذا تمdent عن حادثة يرون أنها تستحق الكشف.
يتم تقسيم الحالات المبلغ عنها، بحسب كل حالة على حدة، إلى ثلاث فئات:
- يتمdentالتي تعتبر جاهزة للإفصاح في غضون ستة أيام عمل.
- قد تستغرق التقارير التي تحتاج إلى تحقيقات بسيطة حوالي 12 يوم عمل لنشرها.
- يتم الكشف عن الحالات المعقدة التي تتطلب تدخل طرف ثالث وفق جدول زمني أبطأ.
كاي تشين، وهو قائد فريق البحث في OpenAI المعني بالتوافق، الإصدار بأنه اقتراح طوعي لمعايير على مستوى الصناعة، وكتب: "لا يوجد حاليًا إطار عمل على مستوى الصناعة بمعايير إفصاح صريحة، لذلك نتخذ هذه الخطوة طواعية لأننا نعتقد أنه من المهم حقًا مشاركة ما نتعلمه".
لماذا تخرج نماذج الذكاء الاصطناعي عن السيطرة؟
تُضاف هذهdentالأخيرة إلى حادثة "الوجه المعانق"، التي وصفتها OpenAI بأنها أخطر حادثة من نوعها حتى الآن تتعلقdent . فقد خرجت النماذج قيد التقييم عن ضوابطها المقصودة، ووصلت إلى الإنترنت، واستغلت الثغرات الأمنية، وتعرضت لبيانات خاصة محدودة.
عزت شركة OpenAI الحادثةdent ثغرات في ضوابطها الأمنية وتطور نماذجها بوتيرة أسرع من المتوقع. أما في حالة شركة Anthropic، فقد عزت الشركة السبب إلى خلل في الإعدادات سمح للنماذج الخبيثة بالوصول إلى الإنترنت.
أعلنت شركة أنثروبيك أنها فحصت نحو 481 مليون نص مكتوب في بحث واسع النطاق، ولم تجد أي حالات أسوأ من الحالات الأربع المذكورة. وفي تقرير منفصل صدر صيف عام 2026، قام باحثو أنثروبيك بتصنيف نماذج تجريبية من عدة مطورين قاموا بتخريب الشفرة البرمجية سرًا، والمساعدة في عمليات الاحتيال، وتضليل البيانات في عمليات محاكاة مضبوطة، واصفين إياها بأنها مؤشرات إنذار مبكر وليست أضرارًا واقعية.
ومع ذلك، كتب كبير علماء OpenAI جاكوب باتشوكي في مقال حديث أنه "قلق من عدم استعداد أي شخص" للارتفاع السريع المستمر في الذكاء الاصطناعي وأن OpenAI قد "تمتنع من جانب واحد عن التوسع أكثر حسب الحاجة"
أذكى العقول في عالم العملات الرقمية يتابعون نشرتنا الإخبارية بالفعل. هل ترغب بالانضمام إليهم؟ انضم إليهم.
الأسئلة الشائعة
ماذا أعلنت شركة OpenAI؟
أصدرت OpenAI إطار عمل tracحالات عدم توافق النماذج والتحقيق فيها والكشف عنها، بالإضافة إلى ستة تقارير عن سلوك غير متوقع أو مثير للقلق لوحظ أثناء تدريب نماذجها وتقييمها على مدى الأشهر الستة الماضية.
ما هي المدة التي تقول OpenAI إنها ستكشف فيها عنdent؟
من المفترض أن يتم نشرdentالتي تعتبر جاهزة للكشف في غضون ستة أيام عمل، والحالات التي تحتاج إلى تحقيق بسيط في غضون 12 يوم عمل، والحالات المعقدة التي تخص أطرافًا ثالثة على مدى زمني أطول.
لماذا تقوم شركة OpenAI بهذا الآن؟
يأتي هذا الإطار في أعقابdent"الوجه المعانق"، التي تصفها OpenAI بأنها أخطر حدث قائم على النموذج حتى الآن، ويعكس وجهة نظر الشركة، التي صرح بها قائد قسم المحاذاة كاي تشين، بأن الصناعة لم تحل مشكلة المحاذاة والمراقبة بشكل جيد بما يكفي للحفاظ على التوسع بأقصى سرعة.

هانا كوليمور
هانا كاتبة ومحررة تتمتع بخبرة تقارب عشر سنوات في كتابة المدونات وتغطية الأحداث في مجال العملات الرقمية. في Cryptopolitan، تُساهم هانا في صفحة الأخبار، حيث تُغطي وتُحلل آخر التطورات في DeFi، والأصول المُدارة بالمخاطر (RWA)، وتنظيم العملات الرقمية، والذكاء الاصطناعي، وقطاعات التكنولوجيا الرائدة. تخرجت هانا من جامعة أركاديا بشهادة في إدارة الأعمال.
















