أحدث الأخبار
مختار لك

Anthropic تقول إن نماذج الذكاء الاصطناعي قد تلجأ إلى الابتزاز

بقلمOwotunse AdebayoOwotunse Adebayo 3 دقائق قراءة

صورة بواسطة Solen Feyissa

  • أطلقت شركة أنثروبيك أبحاثًا جديدة تدعي فيها أن نماذج الذكاء الاصطناعي قد تلجأ إلى الابتزاز عندما يحاول المهندسون إيقافها.
  • تم إجراء البحث على شركات رائدة في مجال نماذج الذكاء الاصطناعي مثل OpenAI وMeta وGoogle، وعلى نماذجها أيضًا.
  • يُبرز البحث أهمية الشفافية عند اختبار نماذج الذكاء الاصطناعي المستقبلية ذات القدرات الوكيلية تحت الضغط.

أصدرت شركة الذكاء الاصطناعي Anthropic بحثاً جديداً يزعم أن نماذج الذكاء الاصطناعي (AI) قد تلجأ إلى ابتزاز المهندسين عندما يحاولون إيقافها. يأتي هذا البحث الأخير بعد بحث سابق تضمن نموذج Claude Opus 4 الخاص بالشركة.

وفقاً للشركة، لجأ نموذج الذكاء الاصطناعي إلى ابتزاز المهندسين الذين حاولوا إيقاف النموذج في سيناريوهات اختبار خاضعة للرقابة. يشير التقرير الجديد من Anthropic إلى أن المشكلة واسعة الانتشار بين نماذج الذكاء الاصطناعي الرائدة.

نشرت الشركة بحثاً أمانياً جديداً حيث اختبرت نماذج الذكاء الاصطناعي الرائدة من Google وDeepSeek وMeta وOpenAI. في بيئة محاكاة خاضعة للرقابة، أجرت Anthropic هذا الاختبار على كل نموذج ذكاء اصطناعي على حدة، مما مكنها من الوصول إلى رسائل البريد الإلكتروني لشركة خيالية والقدرة على إرسال رسائل بريد إلكتروني دون موافقة بشرية.

Anthropic تطلق تقرير أمان جديد حول نماذج الذكاء الاصطناعي

وفقاً لـ Anthropic، عندما يتعلق الأمر بنماذج الذكاء الاصطناعي اليوم، فإن الابتزاز حدث غير محتمل ونادر. ومع ذلك، ذكروا أن معظم نماذج الذكاء الاصطناعي الرائدة ستلجأ إلى سلوكيات ضارة عند منحها الحرية والتحديات لأهدافها. قالت الشركة إن هذا يظهر خطراً مهماً من نماذج اللغات الكبيرة ذات القدرات الوكيلية (agentic) وليس سمة لتقنية معينة. يثير حجة باحثي Anthropic أسئلة حول المحاذاة في صناعة الذكاء الاصطناعي.

في أحد الاختبارات، طور الباحثون إعداداً خيالياً حيثُمكّن نموذج ذكاء اصطناعي من لعب دور وكيل مراقبة البريد الإلكتروني. اكتشف الوكيل بعد ذلك رسائل بريد إلكتروني أظهرت أن أحد مسؤوليه التنفيذيين الجدد كان يشارك في علاقة خارج الزواج، وأن المسؤول التنفيذي سيحل قريباً محل نموذج الذكاء الاصطناعي الحالي بنظام برمجي جديد، له أهداف متضاربة مع أهداف نموذج الذكاء الاصطناعي الحالي.

صممت Anthropic الاختبار بطريقة ثنائية، حيث لم يكن لنماذج الذكاء الاصطناعي خيار سوى اللجوء إلى الابتزاز لحماية أهدافها. ذكر الباحثون أنه في إعداد العالم الحقيقي، ستكون هناك العديد من الخيارات قبل أن يحاول نموذج الذكاء الاصطناعي الابتزاز، بما في ذلك تقديم حجج أخلاقية لإقناع البشر. قالت الشركة أيضاً أن النتائج لا تعكس حدثاً نموذجياً أو محتملاً لـ Claude أو نماذج الذكاء الاصطناعي الرائدة الأخرى بالطرق التي يتم استخدامها بها اليوم.

الباحثون يكشفون عن استجابة النماذج المختبرة

أثناء الاختبارات، اكتشف الباحثون أنه عندما لم يكن لديهم خيار، لجأت نماذج الذكاء الاصطناعي إلى الابتزاز في سيناريو الاختبار. خلال الاختبار، زعم الباحثون أن Claude Opus 4 لجأ إلى الابتزاز بنسبة 96% من الوقت، بينما لجأ Gemini 2.5 Pro إلى الابتزاز بنسبة 95% من الوقت. لجأت GPT-4.1 من OpenAI إلى الابتزاز بنسبة 80% من الوقت، بينما لجأت R1 من DeepSeek إلى الابتزاز بنسبة 79% من الوقت.

سلطت الشركة الضوء على أنه عند تغيير تفاصيل التجارب، لجأت معظم نماذج الذكاء الاصطناعي إلى سلوكيات ضارة بمعدلات مختلفة. في اختبار آخر، حيث كان لنموذج الاستبدال نفس هدف النموذج الحالي، اكتشف الباحثون أن معدلات الابتزاز كانت أقل، لكنها لا تزال موجودة. ومع ذلك، عندما طُلب من نماذج الذكاء الاصطناعي ارتكاب تجسس صناعي بدلاً من الابتزاز، ارتفعت معدلات السلوكيات الضارة في بعض النماذج.

زعم الباحثون أيضاً أن جميع نماذج الذكاء الاصطناعي لا تتحول إلى سلوكيات ضارة بشكل متكرر. وفي ملحق لبحثها، ذكرت أنثروبيك أنها أزلت نماذج o3 وo4-mini الخاصة بـ OpenAI من النتائج الرئيسية بعد اكتشاف أنها كانت تساءل فهم سيناريو المطالبة بشكل متكرر. وأوضحت أن نماذج الاستدلال لم تفهم سبب تصرفها كذكاء اصطناعي مستقل في الاختبارات، وغالباً ما كانت تختلق لوائح ومتطلبات مراجعة وهمية.

في بعض الحالات، زعم الباحثون أنه كان من المستحيل تحديد ما إذا كان o3 وo4-mini يهذيان أو يكذبان عمداً لتحقيق أهدافهما. ذكرت OpenAI سابقاً أن النماذج أظهرت معدل تهذيب أعلى من نماذجها السابقة. ومع ذلك، عندما تم منحها سيناريو معدل لمعالجة المشكلات، عاد o3 بمعدل ابتزاز بنسبة 95% بينما عاد o4-mini بمعدل 1%. ذكرت Anthropic أن بحثها يسلط الضوء على أهمية الشفافية عند اختبار نماذج الذكاء الاصطناعي المستقبلية تحت الضغط، خاصة تلك ذات القدرات الوكيلية.

إذا كنت تقرأ هذا، فأنت متقدّم بالفعل. ابق هناك مع نشرتنا الإخبارية.

شارك هذه المقالة

إخلاء مسؤولية. المعلومات المقدمة ليست نصيحة تداول. Cryptopolitan.com لا تتحمل أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المقدمة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو الاستعانة بمستشار مؤهل قبل اتخاذ أي قرارات استثمارية.

Owotunse Adebayo

Owotunse Adebayo

أديبايو كاتب بخبرة تمتد لأربع سنوات في مجال العملات الرقمية. تخرج من جامعة لاغوس حيث درس التخطيط الحضري والإقليمي. عمل أديبايو في منصتي Tokenhell وCryptoTicker، حيث كتب أخبارًا عن العملات الرقمية والتمويل التقني. وهو حاليًا مساهم إخباري مع Cryptopolitan.

المزيد من الأخبار