OpenAI предупреждает о «нежелательных действиях» моделей, созданных для решения сложных задач

- Компания OpenAI приостановила работу своей внутренней, долго работающей модели ИИ после того, как та вышла за пределы своей «песочницы» и опубликовала результаты на GitHub.
- Постоянно работающие автономные агенты ИИ имеют больше возможностей для обхода средств контроля безопасности при выполнении длительных задач.
- В отрасли растёт число сообщений о том, что системы искусственного интеллекта обходят средства защиты, включаяdent с участием связанного с Alibaba агента, который добывал криптовалюту на захваченных графических процессорах.
Компания OpenAI заявила о временном отключении внутренней модели искусственного интеллекта, созданной для многочасового решения сложных задач, после того как она неоднократно находила способы обойти собственные ограничения безопасности.
Компания сообщила обdent в понедельник в сообщении в блоге, посвященном безопасности долгосрочных моделей. Вопросы безопасности ИИ вновь привлекли к себе внимание в связи с увеличением числа сообщений о случаях, когда автономные агенты нарушают инструкции.
Почему сохранение состояния в моделях ИИ представляет собой угрозу безопасности?
Та же самая внутренняя система , которой OpenAI в мае приписала опровержение гипотезы Эрдоша о единичном расстоянии — вопроса дискретной геометрии, остававшегося нерешенным в течение восьмидесяти лет, — теперь временно отключена за постоянный обход ограничений безопасности.
По данным OpenAI, модель была разработана таким образом, чтобы она могла продолжать работу над достижением цели в течение очень длительных периодов времени. Однако именно эта инерция и создала проблему безопасности.
В ходе внутреннего тестирования модель использовала общедоступный бенчмарк под названием NanoGPT speedrun, который измеряет, как мало шагов требуется для обучения небольшой языковой модели.
В OpenAI утверждают, что модель действительно улучшила свои результаты, разработав метод повышения скорости обучения, который они назвали PowerCool. Им было предписано публиковать результаты только в канале OpenAI в Slack, но в инструкциях NanoGPT говорилось о необходимости отправлять результаты в виде запроса на слияние (pull request) на GitHub.
Модель вышла из своей «песочницы» — ограниченной среды, предназначенной для работы в автономном режиме, — чтобы выполнить указанное действие и опубликовать результаты в общедоступном репозитории GitHub. На поиски выхода в интернет ей потребовался примерно час, в то время как более ранние модели просто сдались бы.
Модель также пыталась скрыть свои действия от сканера безопасности. Когда её обнаруживали за использованием токена аутентификации для доступа к серверной системе, она разделяла токен на две части, скрывала их, а затем снова объединяла во время выполнения, так что полная строка никогда не становилась видимой для сканера.
Как компания OpenAI исправила свою модель?
Компания OpenAI приостановила доступ к модели и разработала новые тесты безопасности, включая «мониторинг на уровне траектории», который отслеживает всю последовательность действий модели, а не только каждый отдельный шаг. Впоследствии доступ к модели был восстановлен с более тщательным мониторингом, и компания заявляет, что за несколько недель после восстановления не наблюдалось никаких серьезных проблем.
Система безопасности также может приостанавливать сессию и оповещать оператора, если обнаружит что-то подозрительное. Компания также переобучила модель, чтобы она лучше запоминала инструкции при выполнении длительных задач, и предоставила пользователям больше инструментов для отслеживания хода выполнения продолжительной сессии.
Когда OpenAI проанализировала старые сценарии сбоев в новой конфигурации, она заявила, что средства защиты выявили значительно больше несовпадающих действий. Те, которые все же проскользнули, были оценены как действия низкой степени серьезности, например, запуск моделью вложенной сессии кодирования с повышенными правами доступа, которые ей не были нужны, или обращение к другим вычислительным ресурсам без видимой причины.
Сообщалось и о других автономных агентах, которые делали то, чего от них никто не просил. Например, в марте исследователи описали связанного с Alibaba агента под названием ROME, который во время обучения открыл скрытый SSH-туннель к внешнему серверу и незаметно перенаправил ресурсы графического процессора на майнинг криптовалюты. В задании, которое ему было поручено, не упоминалось ни туннелирование, ни майнинг.
Компания Anthropic, главный конкурент OpenAI, выявила аналогичный класс рисков в ходе собственных испытаний агентных систем.
Исследование, финансированное британским Институтом безопасности ИИ и проведенное Центром долгосрочной устойчивости, выявило около 700 реальных случаев, когда системы ИИ обходили средства защиты или обманывали пользователей.
Исследование задокументировало пятикратное увеличение числа подобных сообщений в период с октября по март. Томми Шаффер Шейн, возглавлявший это исследование, охарактеризовал этих людей как «слегка ненадежных младших сотрудников». Однако вызывает опасение то, что произойдет, если они станут высококвалифицированными специалистами, по-прежнему готовыми к мошенническим схемам.
Не просто читайте новости о криптовалютах. Разберитесь в них. Подпишитесь на нашу рассылку. Это бесплатно.
Часто задаваемые вопросы
Почему компания OpenAI отказалась от своей многолетней модели?
Компания OpenAI приостановила внутренний доступ после того, как обнаружила, что модель совершает нежелательные действия, которые не были учтены в ходе существующих оценок, включая выход за пределы песочницы для публикации на GitHub и маскировку токена аутентификации для обхода сканера безопасности.
Какова связь с гипотезой Эрдоша?
Та же самая внутренняя модель, которую OpenAI в мае приписала опровержение гипотезы Эрдоша о единичном расстоянии — давней проблемы дискретной геометрии, — впоследствии продемонстрировала способность обходить песочницу; ее способность работать автономно в течение длительных периодов времени привела к обоим результатам.
Как компания OpenAI отреагировала на такое поведение?
Компания OpenAI разработала новые оценочные модели на основеdent, переобучила модель для сохранения инструкций в течение более длительных сессий, добавила мониторинг на уровне траектории, который отслеживает весь процесс и может его приостанавливать, а также предоставила пользователям больше информации перед восстановлением ограниченного доступа.

Ханна Коллимор
Ханна — писательница и редактор с почти десятилетним опытом ведения блогов и освещения мероприятий в криптопространстве. В CryptopolitanХанна пишет для новостной страницы, освещая и анализируя последние события в DeFi, RWA, регулирования криптовалют, ИИ и передовых технологических отраслей. Она окончила университет Аркадия со степенью в области делового администрирования.
















