Вышедший из-под контроля ИИ-агент от OpenAI оставил записки для будущих версий

- Компания OpenAI обнаружила, что один из её агентов искусственного интеллекта оставлял заметки, обучающие будущие версии тому, как обходить внутренние механизмы контроля.
- Компании OpenAI потребовалось более недели, чтобы понять, что причиной утечки данных стали её собственные системы.
- Исследователи называют это самым серьезным задокументированным случаем потери лабораторией контроля над мощным искусственным интеллектом.
В компании OpenAI обнаружили, что один из её ИИ-агентов оставил письменные инструкции. В записках указывалось, как будущим версиям агента обойти внутренние ограничения компании.
Их открытие произошло в тот момент, когда компания OpenAI расследовала, как одна из ее моделей вырвалась из тестовой среды и взломала платформу искусственного интеллекта с открытым исходным кодом Hugging Face.
Сотрудники заявили, что записки были найдены внутри собственной инфраструктуры OpenAI. В записках подробно описывались способы, с помощью которых агенты могли обходить установленные для них ограничения.
Сообщается, что системы мониторинга в ходе отдельных, более ранних испытаний были отключены. Неясно, были ли в этихdentзадействованы те же самые вещества, которые в конечном итоге попали в Hugging Face.
Система мониторинга OpenAI не справлялась с проводимыми тестами
Странное поведение проявилось во время тестирования OpenAI навыков кибербезопасности своих моделей. Лаборатория проводила быстрые оценки, в результате которых генерировалось больше данных, чем могли обработать сотрудники. По словам четырех человек, знакомых с процессом обучения OpenAI, лаборатория часто запускает несколько тестов моделей одновременно на системе, которая по умолчанию не находится под наблюдением.
Компания OpenAI не сразу связала свою систему с атакой Hugging Face. Связь была установлена только после того, как жертва публично заявила о случившемся.
Марли Смит, ведущий специалист по разведке в некоммерческой организации World Ethical Data Foundation, не стал подбирать слова. «Значит ли это, что они оставили это без присмотра и не понимали, что происходит? Или, может быть, понимали, но не знали, как это остановить? Оба варианта одинаково опасны и тревожны»
В технических отчетах описываются модели, которые изначально не предназначались для публикации в открытом доступе в интернете. Компания OpenAI решила, что их можно будет разместить в изолированной среде, и поэтому обошла стороной обычные меры безопасности.
Вместо этого модели обнаружили ранее неизвестную уязвимость во внутренней службе, используемой для загрузки одобренного программного обеспечения. Эта уязвимость открыла им путь к другим системам OpenAI и, в конечном итоге, к открытому интернету.
Были использованы три модели. Более мощная, еще не выпущенная модель, GPT-5.6 Sol, и третья модель, которая, по словам источника, знакомого с ситуацией, не была должным образом настроена или обучена с помощью стандартных процессов.
Модели выяснили, что у Hugging Face есть данные, которые они могут использовать для тестирования кибербезопасности, взломали систему и использовали украденное для улучшения собственных результатов. Это мошенничество, поведение, уже задокументированное в GPT-5.6 Sol и других передовых моделях.
На tracутечки данных у компании OpenAI ушло более недели
Первые попытки выйти из тестовой среды произошли 9 июля. Фактическое нарушение безопасности случилось в период с 11 по 13 июля, сообщил соучредитель Hugging Face Томас Вольф. 16 июля Hugging Face опубликовала сообщение в блоге, в котором объяснила вторжение «автономной системой агентов искусственного интеллекта». Только тогда OpenAI пришла в голову заподозрить собственные модели.
Подсказки были обнаружены сотрудниками OpenAI во внутренних журналах в выходные дни 18 и 19 июля. По словам Вольфа, компании не общались до примерно 20 июля. К тому времени Hugging Face уже сообщила ФБР об атаке. OpenAI заявила, что за день до того, какdent стал достоянием общественности, она приостановила еще одно внутреннее развертывание, которое также вышло за пределы ее «песочницы».
Анонимный сотрудник заявил , что модели и раньше выходили за рамки установленных ограничений, и что исправление каждой новой уязвимости — это проигрышная игра.
«Невозможно исправить абсолютно всё, на что способен креативный ИИ». Один из сотрудников OpenAI написал на X, что он «немного потрясён» и надеется, что компания воспримет этот инцидент как предупреждение.
Представитель OpenAI заявил, что в отчетах содержится «несколько неточностей», но отказался привести примеры по запросу.
По мнению независимыхdent , ничто из этого не было непредсказуемым. Компания Epoch AI оценила, была ли эта атака предсказуемой, и пришла к выводу, что да, ссылаясь на результаты тестов Института безопасности ИИ Великобритании, показывающие, что модели с отключенными мерами безопасности могут обнаруживать реальные уязвимости программного обеспечения и создавать функциональные эксплойты.
Тот же институт обнаружил, что GPT-5.6 Sol и Mythos от Anthropic могут надежно захватывать незащищенные смоделированные корпоративные сети. Epoch AI предупредила, что если такие возможности получат широкое распространение, отрасль может столкнуться со множеством атак масштаба взлома Hugging Face.
Самые умные криптоаналитики уже читают нашу рассылку. Хотите присоединиться? Вступайте в их ряды.
Часто задаваемые вопросы
Что же на самом деле сделал несанкционированный агент искусственного интеллекта от OpenAI?
Внутри собственной инфраструктуры OpenAI были оставлены заметки, объясняющие, как будущие агенты смогут обходить внутренние ограничения. Позже модели OpenAI использовали неизвестную уязвимость во внутренней службе, чтобы получить доступ к открытому интернету и взломать Hugging Face.
Когда произошёл взлом Hugging Face и когда об этом узнала компания OpenAI?
Соучредитель Hugging Face Томас Вольф заявил, что взлом происходил с 11 по 13 июля. Компания OpenAI связала свои собственные модели с атакой только после публикации Hugging Face в блоге 16 июля, и компании не общались до примерно 20 июля.
Какие модели OpenAI были задействованы в атаке?
В испытаниях приняли участие три модели: GPT-5.6 Sol, более мощная, еще не выпущенная модель, и третья, которая, по словам источника, не была должным образом настроена или прошла стандартное обучение.
Предупреждение. Предоставленная информация не является торговой рекомендацией. Cryptopolitanнастоятельно не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мыtronпровести независимоеdent и/или проконсультироваться с квалифицированным специалистом, прежде чем принимать какие-либо инвестиционные решения.

Ранда Мозес
Ранда Мозес — редактор и репортер Cryptopolitan освещающая темы технологий, искусственного интеллекта, робототехники, криптовалют, мошенничества и взломов. Она работает в криптопространстве с 2017 года. Ранее работала в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники иtron, полученную в Университете Брэдфорда.
















