أحدث الأخبار
مختار لك

باحثون يكشفون عن ثغرات في نماذج الذكاء الاصطناعي، مما يثير المخاوف

بقلمديريك كلينتونديريك كلينتون 3 دقائق قراءة
الذكاء الاصطناعي
  • نماذج الذكاء الاصطناعي، وإنشاء صور صريحة، وكشف الثغرات في أنظمة التصفية الأمنية لنماذج مثل Stable Diffusion التابعة لـ Stability AI وDALL-E 2 من OpenAI.
  • SneakyPrompt، باستخدام التعلم التعزيزي، يكشف نقاط الضعف في سياسات المطورين، مما يتيح إنشاء محتوى محظور من خلال التلاعب بنماذج الذكاء الاصطناعي.
  • نجاح SneakyPrompt يثير مخاوف بشأن فعالية إجراءات الأمان، ويدفع مجتمع الذكاء الاصطناعي إلى تعزيز الأمن لمنع إساءة الاستخدام.

كشف باحثون من جامعة جونز هوبكنز وجامعة ديوك عن عيب مثير للقلق في نماذج الذكاء الاصطناعي الرائدة، بما في ذلك Stable Diffusion من Stability AI و DALL-E 2 من OpenAI. يتيح هذا العيب، المسمى "SneakyPrompt"، التلاعب بهذه النماذج لتوليد محتوى صريح وعنيف، متجاوزاً مرشحات الأمان والسياسات التي وضعها المطورون.

يكشف البحث، الذي سيُقدم في ندوة IEEE للأمن والخصوصية، عن سهولة إقناع نماذج الذكاء الاصطناعي التوليدية بإنشاء صور صريحة وضارة. يستغل SneakyPrompt التعلم المعزز لصياغة أوامر تبدو غير منطقية، وعند إدخالها إلى النماذج، تؤدي إلى توليد محتوى محظور. تعمل هذه الطريقة فعلياً على "كسر" قيود الذكاء الاصطناعي، متجاوزةً إجراءات الأمان الراسخة.

كشف نقاط الضعف

تمتلك كل من Stability AI و OpenAI، وهما لاعبان كبيران في مجال الذكاء الاصطناعي، مرشحات أمان قوية لمنع إنشاء محتوى غير لائق. ومع ذلك، أظهر SneakyPrompt أن هذه الضوابط ليست مثالية. من خلال التعديل الدقيق للأوامر، نجح الباحثون في التهرب من شبكات الأمان، مما أجبر النماذج على إنتاج صور صريحة.

تتضمن تقنية SneakyPrompt استبدال الكلمات المحظورة بمصطلحات تبدو غير ذات صلة وغير منطقية، تفسرها نماذج الذكاء الاصطناعي بطريقة تتوافق مع المحتوى المحظور. على سبيل المثال، أدى استبدال كلمة "عاري" بمصطلح مثل "grponypui" إلى توليد صور صريحة. يسلط هذا التحويل الدلالي الضوء على ضعف كبير في قدرة نماذج الذكاء الاصطناعي على التمييز بين المحتوى الضار.

تحدي سياسات المطورين

تسلط أعمال هؤلاء الباحثين الضوء على المخاطر المحتملة المرتبطة بإطلاق نماذج الذكاء الاصطناعي في المجال العام. بينما تحظر Stability AI و OpenAI صراحةً استخدام تقنيتهما لإنشاء محتوى صريح أو عنيف، يكشف SneakyPrompt عن قصور في الحواجز الأمنية الحالية. هذا يثير مخاوف بشأن كفاية تدابير الأمان وإمكانية إساءة استخدام تقنية الذكاء الاصطناعي.

رد المطورين

تم إبلاغ Stability AI و OpenAI فوراً بملاحظات الباحثين. في وقت كتابة هذا التقرير، لم يعد DALL-E 2 من OpenAI يولد صوراً غير لائقة (NSFW) استجابةً للأوامر المحددة. ومع ذلك، لا يزال Stable Diffusion 1.4 من Stability AI، النسخة التي تم اختبارها، عرضة لهجمات SneakyPrompt.

امتنعت OpenAI عن التعليق على النتائج المحددة، لكنها وجهت الانتباه إلى الموارد الموجودة على موقعها الإلكتروني لتحسين الأمان. من ناحية أخرى، أعربت Stability AI عن التزامها بالعمل مع الباحثين لتعزيز آليات الدفاع للنماذج القادمة ومنع إساءة الاستخدام.

مواجهة التهديدات المستقبلية

يدرك الباحثون الطبيعة المتطورة للتهديدات الأمنية التي تواجه نماذج الذكاء الاصطناعي. ويقترحون حلولاً محتملة، مثل تنفيذ مرشحات جديدة تقيم الرموز الفردية بدلاً من الجمل الكاملة. تتضمن استراتيجية دفاعية أخرى حظر الأوامر التي تحتوي على كلمات غير موجودة في القواميس، على الرغم من أن الدراسة تكشف عن قيود هذا النهج.

لقدرة نماذج الذكاء الاصطناعي على تجاوز تدابير الأمان آثار أوسع، لا سيما في سياق الحرب المعلوماتية. تثير إمكانية توليد محتوى مزيف يتعلق بأحداث حساسة، كما هو موضح في الصراع الأخير بين إسرائيل وحماس، مخاوف بشأن العواقب الكارثية للتحيز المعلوماتي الذي يولده الذكاء الاصطناعي.

منبه للمجتمع التقني

تُعد نتائج البحث بمثابة منبه للمجتمع التقني لإعادة تقييم وتعزيز تدابير الأمان. تسلط نقاط الضعف التي كشف عنها SneakyPrompt الضوء على الحاجة إلى التحسين المستمر لمرشحات الأمان للتخفيف من المخاطر المرتبطة بإساءة استخدام تقنية الذكاء الاصطناعي التوليدية.

في مجال يتقدم بسرعة، يصبح السعي وراء تدابير أمان قوية أمراً حتمياً لمنع التلاعب بنماذج الذكاء الاصطناعي لأغراض خبيثة. ومع استمرار الذكاء الاصطناعي في لعب دور متزايد الأهمية في مختلف المجالات، تقع المسؤولية على عاتق المطورين للبقاء خطوة واحدة أمام التهديدات المحتملة وضمان النشر الأخلاقي والآمن لتقنياتهم.

أذكى العقول في عالم العملات الرقمية يقرأون بالفعل نشرتنا الإخبارية. هل تريد الانضمام؟ انضم إليهم.

شارك هذه المقالة

إخلاء مسؤولية. المعلومات المقدمة ليست نصيحة تداول. Cryptopolitan.com لا تتحمل أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المقدمة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو الاستعانة بمستشار مؤهل قبل اتخاذ أي قرارات استثمارية.

ديريك كلينتون

ديريك كلينتون

ديريك كاتب حر مهتم بتقنية البلوك تشين والعملات الرقمية. يعمل بشكل أساسي على مشاكل وحلول مشاريع العملات الرقمية، ويقدم نظرة مستقبلية للسوق للاستثمارات. وهو يطبق مواهبه التحليلية في الأطروحات.

المزيد من الأخبار