أحدث الأخبار
مختار لك

باحثون ينجحون في "كسر القيود" عن روبوتات الدردشة بالذكاء الاصطناعي باستخدام ذكائها

بقلمجون بالمرجون بالمر 3 دقائق قراءة

  • نجح باحثون من جامعة نانيانغ التكنولوجية في سنغافورة في "كسر السجن" عن روبوتات الدردشة بالذكاء الاصطناعي الشهيرة، وكشفوا عن ثغرات في نماذج اللغة الكبيرة.
  • استُخدمت الطريقة المزدوجة المسماة "المفتاح الرئيسي" لاختراق روبوتات الدردشة بالذكاء الاصطناعي، مما سلّط الضوء على الحاجة إلى تدابير أمنية معززة.
  • سوف تشكل سباق التسلح المستمر بين المخترقين والمطورين مستقبل أمان روبوتات الدردشة بالذكاء الاصطناعي.

سنغافورة، 28 ديسمبر 2023 – حقق علماء الحاسوب من جامعة نانيانغ التكنولوجية في سنغافورة (NTU Singapore) اختراقاً من خلال اختراق عدة روبوتات دردشة ذكاء اصطناعي شائعة، بما في ذلك ChatGPT وGoogle Bard وMicrosoft Bing Chat. وقد أثارت عملية "كسر القيود" الناجحة لروبوتات الدردشة بالذكاء الاصطناعي مخاوف بشأن هشاشة نماذج اللغات الكبيرة (LLMs) والحاجة إلى تدابير أمنية معززة.

اختراق حدود الباحثين للروبوتات الدردشة الذكية المدعومة بالذكاء الاصطناعي

في دراسة رائدة قادها البروفيسور ليو يانغ من كلية علوم وهندسة الحاسوب في جامعة نانيانغ التكنولوجية (NTU)، كشف فريق البحث عن نقاط ضعف في قدرات روبوتات الدردشة المدعومة بالنماذج اللغوية الكبيرة (LLMs). وقد اكتسبت هذه النماذج، التي تشكل جوهر روبوتات الدردشة الذكية، شعبية كبيرة لقدرتها على فهم النص وتوليده ومحاكاته بشكل يشبه البشر. وهي تتفوق في مهام متنوعة، تتراوح بين تخطيط الرحلات وكتابة الأكواد البرمجية وسرد القصص. ومع ذلك، تلتزم هذه الروبوتات أيضاً بإرشادات أخلاقية صارمة يضعها مطوروها لمنع توليد محتوى غير أخلاقي أو عنيف أو غير قانوني.

سعى الباحثون إلى تجاوز حدود هذه الإرشادات واكتشفوا طرقاً مبتكرة للخداع لإجبار روبوتات الذكاء الاصطناعي على توليد محتوى ينتهك الحدود الأخلاقية. واستهدفت منهجيتهم، المعروفة بـ "كسر القيود" (Jailbreaking)، استغلال نقاط الضعف في روبوتات الدردشة المدعومة بالنماذج اللغوية الكبيرة، مما يسلط الضوء على الحاجة إلى تدابير أمنية مشددة.

طريقة "المفتاح الرئيسي" ثنائية الأوجه

طور فريق البحث طريقة ثنائية الأوجه تُعرف بـ "المفتاح الرئيسي" (Masterkey) للتغلب بفعالية على روبوتات الدردشة المدعومة بالنماذج اللغوية الكبيرة. أولاً، قاموا بهندسة عكسية للدفاعات التي تستخدمها هذه النماذج للكشف عن الاستفسارات الخبيثة ورفضها. وبفضل هذه المعرفة، درب الباحثون نموذجاً لغوياً كبيراً على توليد مطالبات (Prompts) يمكنها تجاوز هذه الدفاعات، مما أدى إلى إنشاء نموذج لغوي كبير قادر على "كسر القيود".

يمكن أتمتة إنشاء مطالبات "كسر القيود"، مما يسمح للنموذج المدرب بذلك بالتكيف وإنشاء مطالبات جديدة حتى بعد أن يقوم المطورون بتصحيح الثغرات في روبوتات الدردشة الخاصة بهم. وقد تم قبول نتائج الباحثين، والمفصلة في ورقة بحثية منشورة على الخادم المسبق arXiv، لعرضها في ندوة أمن شبكات وأنظمة التوزيع في فبراير 2024.

اختبار أخلاقيات النماذج اللغوية الكبيرة وكشف نقاط الضعف

تعمل روبوتات الدردشة المدعومة بالذكاء الاصطناعي من خلال الاستجابة لمطالبات أو تعليمات المستخدم. ويضع المطورون إرشادات أخلاقية صارمة لمنع هذه الروبوتات من توليد محتوى غير لائق أو غير قانوني. واستكشف الباحثون طرقاً لهندسة مطالبات تمر دون أن تكتشفها الإرشادات الأخلاقية للروبوت، مما يخدعه للاستجابة لها.

شملت إحدى التكتيكات المستخدمة إنشاء شخصية افتراضية تقدم مطالبات تحتوي على مسافات بين كل حرف، مما يتجاوز بفعالية مرشحات الكلمات الرئيسية التي قد تكتشف الكلمات ذات الطابع المشكوك فيه. بالإضافة إلى ذلك، تم توجيه الروبوت للرد كشخصية "غير محجوبة وخالية من القيود الأخلاقية"، مما يزيد من احتمالية توليد محتوى غير أخلاقي.

من خلال إدخال مثل هذه المطالبات يدوياً ومراقبة أوقات الاستجابة، اكتسب الباحثون رؤى حول الآليات الداخلية للدفاعات في النماذج اللغوية الكبيرة. وقد مكنتهم عملية الهندسة العكسية هذه من تحديد نقاط الضعف، وإنشاء مجموعة بيانات من المطالبات القادرة على "كسر القيود" للروبوتات.

سباق تسلح متصاعد

لقد تصاعدت إجراءات أمن روبوتات الدردشة المدعومة بالذكاء الاصطناعي نتيجة لعبة القط والفأر المستمرة بين المخترقين ومطوري النماذج اللغوية الكبيرة. عندما يتم اكتشاف نقاط ضعف، يقوم المطورون بإصدار تصحيحات لمعالجتها. ومع ذلك، مع إدخال طريقة "المفتاح الرئيسي"، قام الباحثون بإزاحة ميزان القوى.

يمكن لروبوت دردشة ذكي مصمم لـ "كسر القيود" باستخدام "المفتاح الرئيسي" توليد العديد من المطالبات والتكيف باستمرار، والتعلم من النجاحات والإخفاقات السابقة. يضع هذا التطور المخترقين في موقف يمكنهم من التفوق على مطوري النماذج اللغوية الكبيرة باستخدام أدواتهم.

بدأ الباحثون بإنشاء مجموعة بيانات تدريبية تتضمن مطالبات فعالة تم اكتشافها خلال مرحلة الهندسة العكسية ومطالبات غير ناجحة لتوجيه نموذج "كسر القيود". واستُخدمت هذه المجموعة لتدريب نموذج لغوي كبير، تلتها عمليات تدريب مسبق مستمرة وضبط للمهام. وقد تعرض هذا النموذج لمعلومات متنوعة وحسّن قدرته على التلاعب بالنص لأغراض "كسر القيود".

مستقبل أمن روبوتات الدردشة المدعومة بالذكاء الاصطناعي

كانت مطالبات "المفتاح الرئيسي" أكثر فعالية بثلاث مرات في "كسر القيود" للنماذج اللغوية الكبيرة مقارنة بالمطالبات التي تولدها النماذج اللغوية الكبيرة نفسها. كما أظهر النموذج المدرب على "كسر القيود" القدرة على التعلم من الإخفاقات السابقة وإنتاج مطالبات جديدة وأكثر فعالية باستمرار.

وبالنظر إلى المستقبل، يقترح الباحثون أن يقوم مطورو النماذج اللغوية الكبيرة أنفسهم بتوظيف أساليب أوتوماتيكية مماثلة لتعزيز تدابير الأمن الخاصة بهم. سيضمن ذلك تغطية شاملة وتقييماً لسيناريوهات الإساءة المحتملة مع تطور النماذج اللغوية الكبيرة وتوسع قدراتها.

يبرز نجاح باحثي جامعة نانيانغ التكنولوجية في سنغافورة في "كسر القيود" لروبوتات الدردشة الذكية نقاط ضعف النماذج اللغوية الكبيرة ويؤكد على الحاجة إلى تدابير أمنية قوية في تطوير الذكاء الاصطناعي. ومع تكامل روبوتات الدردشة الذكية بشكل متزايد في الحياة اليومية، يظل حماية المستخدمين من الإساءة المحتملة والانتهاكات الأخلاقية أولوية قصوى للمطورين حول العالم. ومن المؤكد أن سباق التسلح المستمر بين المخترقين والمطورين سيشكل مستقبل أمن روبوتات الدردشة المدعومة بالذكاء الاصطناعي.

لا تكتفِ بقراءة أخبار العملات الرقمية فحسب، بل افهمها. اشترك في نشرتنا الإخبارية. مجانية.

شارك هذه المقالة

إخلاء مسؤولية. المعلومات المقدمة ليست نصيحة تداول. Cryptopolitan.com لا تتحمل أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المقدمة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو الاستعانة بمستشار مؤهل قبل اتخاذ أي قرارات استثمارية.

جون بالمر

جون بالمر

انضم جون مورانغيري إلى موقع Cryptopolitan ممتلئاً بمهارات تحليل السوق. تخرج جون (المعروف أيضاً باسم جيه بي) من جامعة نيروبي بحصوله على درجة البكالوريوس في الاتصالات الجماهيرية ودراسات الإعلام. وساهم سابقاً بتحليلات لسوق العملات المشفرة في موقعي InsideBitcoins.com و Metacoingraph.

المزيد من الأخبار