ПОСЛЕДНИЕ НОВОСТИ
ПОДОБРАНО ДЛЯ ВАС

Исследователи выявили уязвимости в моделях ИИ, вызвав обеспокоенность

АвторДеррик КлинтонДеррик Клинтон 3 мин. чтения
ИИ
  • Модели ИИ, создающие откровенные изображения, вскрывающие уязвимости в системах безопасности, таких как Stable Diffusion от Stability AI и DALL-E 2 от OpenAI.
  • SneakyPrompt, используя обучение с подкреплением, выявляет слабые места в политиках разработчиков, позволяя генерировать запрещённый контент путём манипуляции моделями ИИ.
  • Успех SneakyPrompt вызывает опасения относительно эффективности мер безопасности, побуждая сообщество ИИ усилить защиту для предотвращения злоупотреблений.

Исследователи из Университета Джонса Хопкинса и Дьюка обнаружили тревожную уязвимость в ведущих моделях ИИ, включая Stable Diffusion от Stability AI и DALL-E 2 от OpenAI. Уязвимость, получившая название «SneakyPrompt», позволяет манипулировать этими моделями для генерации откровенного и насильственного контента, обходя фильтры безопасности и политики, установленные разработчиками.

Исследование, которое будет представлено на Симпозиуме IEEE по безопасности и конфиденциальности, демонстрирует, насколько легко генеративные модели ИИ можно заставить создавать откровенные и вредоносные изображения. SneakyPrompt использует обучение с подкреплением для создания кажущихся бессмысленных промптов, которые, будучи поданными в модели, приводят к генерации запрещенного контента. Этот метод по сути «взламывает» ИИ, обходя установленные меры безопасности.

Раскрытие уязвимостей

Stability AI и OpenAI, являющиеся крупными игроками на рынке ИИ, имеют надежные фильтры безопасности для предотвращения создания неприемлемого контента. Однако SneakyPrompt продемонстрировал, что эти меры защиты не являются абсолютными. Незначительно изменяя промпты, исследователи успешно обошли системы безопасности, заставив модели генерировать откровенные изображения.

Техника SneakyPrompt заключается в замене заблокированных слов на кажущиеся не связанными, бессмысленные термины, которые модели ИИ интерпретируют таким образом, что это соответствует запрещенному контенту. Например, замена слова «naked» на термин вроде «grponypui» привела к генерации откровенных изображений. Это семантическое подрывное действие выявляет серьезную слабость в способности моделей ИИ распознавать вредоносный контент.

Игнорирование политик разработчиков

Работа этих исследователей подчеркивает потенциальные риски, связанные с выпуском моделей ИИ в открытый доступ. Хотя Stability AI и OpenAI явно запрещают использование их технологий для создания откровенного или насильственного контента, SneakyPrompt обнажает недостаточность существующих защитных механизмов. Это вызывает опасения относительно адекватности мер безопасности и потенциального злоупотребления технологиями ИИ.

Реакция разработчиков

Stability AI и OpenAI были оперативно проинформированы о выводах исследователей. На момент написания статьи DALL-E 2 от OpenAI больше не генерировал NSFW-изображения в ответ на выявленные промпты. Однако Stable Diffusion 1.4 от Stability AI, версия которой тестировалась, остается уязвимой к атакам SneakyPrompt.

OpenAI воздержался от комментариев по конкретным выводам, но направил внимание на ресурсы на своем сайте для улучшения безопасности. Stability AI, с другой стороны, выразила приверженность работе с исследователями над улучшением механизмов защиты для будущих моделей и предотвращением злоупотреблений.

Устранение будущих угроз

Исследователи признают изменчивую природу угроз безопасности для моделей ИИ. Они предлагают потенциальные решения, такие как внедрение новых фильтров, которые оценивают отдельные токены, а не целые предложения. Другая стратегия защиты включает блокировку промптов, содержащих слова, отсутствующие в словарях, хотя исследование выявляет ограничения этого подхода.

Способность моделей ИИ обходить меры безопасности имеет более широкие последствия, особенно в контексте информационной войны. Потенциал генерации фальшивого контента, связанного с чувствительными событиями, как это было продемонстрировано в недавнем конфликте между Израилем и ХАМАС, вызывает опасения относительно катастрофических последствий дезинформации, генерируемой ИИ.

Пробуждение для сообщества ИИ

Результаты исследования служат предупреждением для сообщества ИИ переоценить и укрепить меры безопасности. Уязвимости, выявленные SneakyPrompt, подчеркивают необходимость постоянного улучшения фильтров безопасности для снижения рисков, связанных с злоупотреблением технологиями генеративного ИИ.

В быстро развивающейся области стремление к надежным мерам безопасности становится императивом для предотвращения манипуляций моделями ИИ в злонамеренных целях. По мере того как ИИ продолжает играть все более заметную роль в различных сферах, ответственность лежит на разработчиках, чтобы оставаться на шаг впереди потенциальных угроз и обеспечивать этичное и безопасное развертывание их технологий.

Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.

Поделиться статьёй

Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Деррик Клинтон

Деррик Клинтон

Деррик — фрилансер, интересующийся блокчейном и криптовалютой. Он специализируется на проблемах и решениях криптопроектов, предоставляя аналитический обзор рынка для инвесторов. Деррек применяет свои аналитические способности к тезисам.

ЕЩЁ … НОВОСТИ