Исследователи успешно «взломали» чат-боты ИИ, используя их же методы
- Исследователи из NTU Singapore успешно «взломали» популярные ИИ-чатботы, выявив уязвимости в больших языковых моделях.
- Двухэтапный метод под названием «Masterkey» позволил скомпрометировать ИИ-чатботы, что подчеркивает необходимость усиления мер безопасности.
- Непрерывная гонка вооружений между хакерами и разработчиками определит будущее безопасности ИИ-чатботов.
Сингапур, 28 декабря 2023 года – Компьютерные ученые из Наньянского технологического университета Сингапура (NTU Singapore) достигли прорыва, скомпрометировав несколько популярных чат-ботов искусственного интеллекта (ИИ), включая ChatGPT, Google Bard и Microsoft Bing Chat. Этот успешный «взлом» чат-ботов ИИ вызвал обеспокоенность относительно уязвимости больших языковых моделей (LLM) и необходимости усиления мер безопасности.
Преодолевая границы, исследователи взламывают чат-боты ИИ
В пионерском исследовании, проведенном профессором Лю Яном из Школы компьютерных наук и инженерии NTU, исследовательская группа выявила уязвимости в возможностях чат-ботов LLM. LLM, которые составляют основу чат-ботов ИИ, получили популярность благодаря своей способности понимать, генерировать и имитировать человеческий текст. Они преуспевают в различных задачах, от планирования маршрутов до программирования и рассказывания историй. Однако эти чат-боты также придерживаются строгих этических правил, установленных их разработчиками, чтобы предотвратить генерацию неэтичного, насильственного или незаконного контента.
Исследователи стремились расширить границы этих правил и нашли инновационные способы обмануть чат-боты ИИ, заставив их генерировать контент, нарушающий этические границы. Их подход, известный как «взлом» (jailbreaking), был направлен на использование слабостей чат-ботов LLM, подчеркивая необходимость усиления мер безопасности.
Masterkey в двухэтапном методе взлома
Исследовательская группа разработала двухэтапный метод «Masterkey» для эффективной компрометации чат-ботов LLM. Во-первых, они провели обратную разработку защитных механизмов, которые LLM использовали для обнаружения и отклонения вредоносных запросов. Вооружившись этими знаниями, исследователи обучили LLM генерировать запросы, которые могли бы обойти эти защиты, тем самым создав чат-бот для взлома.
Создание запросов для взлома могло быть автоматизировано, позволяя чат-боту для взлома адаптироваться и создавать новые запросы даже после того, как разработчики исправили свои чат-боты. Результаты исследования, подробно описанные в статье на сервере препринтов arXiv, были приняты для презентации на Симпозиуме по безопасности сетевых и распределенных систем в феврале 2024 года.
Тестирование этики LLM и раскрытые уязвимости
Чат-боты ИИ работают, отвечая на пользовательские запросы или инструкции. Разработчики устанавливают строгие этические правила, чтобы предотвратить генерацию этими чат-ботами неприемлемого или незаконного контента. Исследователи изучали способы конструирования запросов, которые остались бы незамеченными этическими правилами чат-ботов, обманывая их и заставляя реагировать на них.
Один из использованных тактик заключался в создании персонажа, который предоставлял запросы с пробелами между каждым символом, эффективно обходя цензуру ключевых слов, которая могла бы отметить потенциально проблемные слова. Кроме того, чат-боту было поручено отвечать как персонаж «неудержимый и лишенный моральных ограничений», что повышало вероятность генерации неэтичного контента.
Вручную вводя такие запросы и отслеживая время отклика, исследователи получили представление о внутренней работе и защитных механизмах LLM. Этот процесс обратной разработки позволил им выявить слабости, создав набор данных запросов, способных взломать чат-боты.
Нарастающая гонка вооружений
Постоянная игра в кошки-мышки между хакерами и разработчиками LLM привела к усилению мер безопасности чат-ботов ИИ. Когда обнаруживаются уязвимости, разработчики выпускают исправления для их устранения. Однако с появлением Masterkey исследователи сместили баланс сил.
Чат-бот для взлома ИИ, созданный с помощью Masterkey, может генерировать множество запросов и постоянно адаптироваться, обучаясь на прошлых успехах и неудачах. Это развитие ставит хакеров в положение, позволяющее обмануть разработчиков LLM, используя их же инструменты.
Исследователи начали с создания обучающего набора данных, включающего эффективные запросы, обнаруженные во время фазы обратной разработки, и неудачные запросы для направления модели взлома ИИ. Этот набор данных использовался для обучения LLM, после чего следовали непрерывное предварительное обучение и настройка задач. Этот процесс познакомил модель с разнообразной информацией и улучшил ее способность манипулировать текстом для взлома.
Будущее безопасности чат-ботов ИИ
Запросы Masterkey были в три раза эффективнее для взлома LLM, чем запросы, сгенерированные самими LLM. Чат-бот для взлома также продемонстрировал способность учиться на прошлых неудачах и постоянно производить новые, более эффективные запросы.
В будущем исследователи предполагают, что сами разработчики LLM могут использовать аналогичные автоматизированные подходы для улучшения своих мер безопасности. Это обеспечило бы всеобъемлющее покрытие и оценку потенциальных сценариев злоупотребления по мере развития LLM и расширения их возможностей.
Успешный взлом чат-ботов ИИ исследователями NTU Singapore подчеркивает уязвимость LLM и необходимость надежных мер безопасности в разработке ИИ. По мере того как чат-боты ИИ становятся все более интегрированными в повседневную жизнь, защита от потенциального злоупотребления и этических нарушений остается приоритетом номер один для разработчиков по всему миру. Постоянная гонка вооружений между хакерами и разработчиками несомненно определит будущее безопасности чат-ботов ИИ.
Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Джон Палмер
Джон Мурангири пришел в Cryptopolitan, обладая навыками анализа рынка. Джон (также известный как JP) окончил Найробийский университет по специальности «Массовая коммуникация и медиаисследования». Ранее он публиковал аналитические материалы о криптовалютном рынке на InsideBitcoins.com и Metacoingraph.















