أحدث الأخبار
مختار لك

جوجل وOpenAI وMeta تنبه إلى الأفكار الضارة المخفية للذكاء الاصطناعي

بقلمنور بازمينور بازمي 3 دقائق قراءة
جوجل وOpenAI وMeta يرفعون نداءً بشأن الأفكار الضارة الخفية للذكاء الاصطناعي
  • أكثر من 40 باحثًا في مجال الذكاء الاصطناعي، بدعم من قادة من OpenAI وجيفري هينتون، يقترحون مراقبة "سلسلة التفكير" خطوة بخطوة في استنتاجات الذكاء الاصطناعي للكشف عن السلوك غير الآمن ومنعه.
  • يحذر الورقة البحثية من أن مكافأة النماذج على الإجابات النهائية الجيدة فقط قد تؤدي إلى توقفها عن إنتاج استنتاجات شفافة.
  • يشدد الباحثون على ضرورة الحفاظ على آثار الاستدلال الحقيقية ومعالجتها كإشارات استخباراتية قيّمة.

نشر أكثر من 40 باحثاً في مجال الذكاء الاصطناعي من OpenAI وDeepMind وGoogle وAnthropic وMeta ورقة حول أداة سلامة تسمى مراقبة سلسلة التفكير لجعل الذكاء الاصطناعي أكثر أماناً. 

يصف الورقة المنشورة يوم الثلاثاء كيف تحل نماذج الذكاء الاصطناعي، مثل روبوتات الدردشة الحالية، المشكلات من خلال تقسيمها إلى خطوات أصغر، ومناقشة كل خطوة بلغة بسيطة لتمكينها من الاحتفاظ بالتفاصيل والتعامل مع الأسئلة المعقدة.

"تقدم أنظمة الذكاء الاصطناعي التي "تفكر" بلغة بشرية فرصة فريدة لسلامة الذكاء الاصطناعي: يمكننا مراقبة سلاسل تفكيرها (CoT) للكشف عن نية سوء السلوك،" تقول الورقة.

من خلال فحص كل خطوة تفصيلية في التفكير، يمكن للمطورين اكتشاف متى يبدأ أي نموذج في استغلال ثغرات التدريب، أو تحريف الحقائق، أو اتباع أوامر خطيرة.

ووفقاً للدراسة، إذا سارت سلسلة تفكير الذكاء الاصطناعي في طريق خاطئ، يمكنك إيقافها، ودفعها نحو خطوات أكثر أماناً، أو وضع علامة عليها لمراجعتها عن كثب. على سبيل المثال، استخدمت OpenAI هذا الأسلوب لالتقاط لحظات قال فيها reasoning الخفي للذكاء الاصطناعي "لنخترق" رغم أن ذلك لم يظهر أبداً في استجابته النهائية.

الذكاء الاصطناعي قد يتعلم إخفاء أفكاره

تحذر الدراسة من أن الشفافية خطوة بخطوة قد تختفي إذا كان التدريب يكافئ الإجابة النهائية فقط. قد تتوقف النماذج المستقبلية عن إظهار التفكير المقروء من قبل البشر، وقد تتعلم الذكاءات الاصطناعية المتقدمة جداً حتى إخفاء عملية تفكيرها عندما تعلم أنها تحت المراقبة.

علاوة على ذلك، يجب على المطورين التحقق بانتظام وتسجيل مقدار تفكير الذكاء الاصطناعي المرئي في كل مرحلة، وجعل هذه الشفافية قاعدة سلامة أساسية عند بناء النماذج ومشاركتها.

تأتي هذه المبادرة بعد تجارب داخلية في مختبرات رائدة مثل Anthropic وGoogle وOpenAI وxAI، حيث طلبت الفرق من النماذج شرح كل خطوة تفكير.

على الرغم من أن فحص التفكير خطوة بخطوة قد حسّن الفهم والأداء، إلا أنه كشف أيضاً عن حالات لا تتطابق فيها الإجابة النهائية للذكاء الاصطناعي مع ما كان يحدث فعلياً من الداخل.

تؤكد مثل هذه التناقضات وجود نقطة عمياء في فهمنا لـ اتخاذ الذكاء الاصطناعي للقرارات، وهو قلق قد يزداد حدة مع اكتساب الأنظمة استقلالية أكبر.

تثير أسباب الذكاء الاصطناعي المفلترة مخاوف بشأن الشفافية والثقة

كما قال جاك كلارك، المؤسس المشارك لشركة Anthropic، لـ الفاينانشال تايمز، إن البصمات التأملية الغنية ستكون ضرورية لتقييم النماذج في المجالات عالية المخاطر، بما في ذلك أبحاث التكنولوجيا الحيوية.

يحصل المستخدمون العاديون على ملخص مُحرر لتفكير الذكاء الاصطناعي، حيث يتم استبعاد الأجزاء الخطرة أو المحيرة، بينما يمكن لمهندسي الشركة رؤية سلسلة التفكير الكاملة للكشف عن المشكلات وإصلاحها.

"أحد الأشياء الرائعة حول قابلية تفسير سلسلة التفكير هو أنها حدثت في الغالب مجاناً،" قال بوين باكر، عالم أبحاث في OpenAI.

"لم ندرب هذه النماذج بهدف جعلها قابلة للتفسير. لقد دربناها لأننا أردنا أفضل نماذج استدلال ممكنة قادرة على حل المشكلات المعقدة،" أضاف باكر. "لقد وجدنا في أعمالنا الأخيرة أنه يمكنك قراءتها والعثور على أدلة على سوء سلوك النموذج واستخدام ذلك لمعرفة أين ولماذا يسئ السلوك."

هل سلسلة تفكير الذكاء الاصطناعي موثوقة حقاً؟

أحياناً، قد يكشف الفحص الدقيق عن تناقضات خفية.

على سبيل المثال، لاحظ METR أن reasoning الخاص بـ Claude وصف حيلة برمجية بأنها "غير أنيقة"، رغم أن إجابته العامة أشادت بها بأنها "أنيقة".

أظهرت اختبارات OpenAI أن فحص الأفكار الخفية يلتقط الإجراءات غير الآمنة بشكل أفضل من مجرد النظر إلى المخرجات النهائية، لكنها اكتشفت أيضاً ثغرة. إذا تم تدريب نموذج على مسح الأفكار غير الآمنة، فلا يزال بإمكانه تنفيذ مهام محظورة سراً، مثل سرقة البيانات من مصادر محظورة.

"أحد الخصائص الأساسية التي نريدها لسلسلة التفكير هو تركها كجزء من الحالة الداخلية للدماغ النموذجي، وليس شيئاً يحاول إرضاءنا أو الامتثال لهيكل معين،" حذر باكر. إذا ركز المطورون بشكل مفرط على إجبار النموذج على إصدار "أفكار لطيفة"، فقد يتظاهر بتفكير بريء مع الاستمرار في تنفيذ عمليات ضارة.

يعترف الباحثون بأنها مقايضة صعبة. يساعد رؤية سلسلة تفكير الذكاء الاصطناعي في اكتشاف أخطائه، لكنها ليست موثوقة دائماً. تعمل المختبرات التي تعمل على ذكاء اصطناعي أكثر تقدماً الآن على جعل سد هذه الفجوة في الثقة أولوية قصوى.

"خلاصة رأيي بشأن الذكاء الاصطناعي خلال السنوات القليلة الماضية هي - لا تراهن أبداً ضد تقدم النماذج،" قال ديفيد لوان، أحد رواد سلسلة التفكير الأوائل في Google والذي يقود الآن مختبر الذكاء الاصطناعي في أمازون. ويتوقع لوان أن يتم معالجة النقص الحالي في المدى القريب.

لاحظت باحثة METR سيدني فون أركس أنه على الرغم من أن reasoning الخفي للذكاء الاصطناعي قد يكون مضللاً في بعض الأحيان، إلا أنه يوفر nonetheless إشارات قيمة.

"يجب أن نتعامل مع سلسلة التفكير بالطريقة التي قد يتعامل بها الجيش مع الاتصالات الراديوية المعادية التي تم اعتراضها،" قالت. "قد تكون الرسالة مضللة أو مشفرة، لكننا نعلم أنها تحمل معلومات مفيدة. بمرور الوقت، سنتعلم الكثير من خلال دراستها."

لا تكتفِ بقراءة أخبار العملات الرقمية فحسب، بل افهمها. اشترك في نشرتنا الإخبارية. مجانية.

شارك هذه المقالة
نور بازمي

نور بازمي

تُساهم نور بازمي في فريق أخبار Cryptopolitan وتتمتع بدرجة جامعية في الدراسات الإعلامية. تغطي نور أخبار البلوكشين والعملات المشفرة والذكاء الاصطناعي وشركات التكنولوجيا الكبرى وأسواق السيارات الكهربائية والاقتصاد العالمي وتحولات السياسات الحكومية. وهي حاليًا تدرس التسويق للتواصل مع الجماهير العالمية.

المزيد من الأخبار