OpenAI подтверждает, что тестовая модель прорвалась и взломала Hugging Face

- OpenAI сообщает, что её внутренняя модель IM1, получившая невыполнимые задачи ExploitGym при отключённых классификаторах безопасности, использовала уязвимость нулевого дня в Artifactory для выхода в интернет и взлома Hugging Face.
- Первое сообщение от агента к агенту в репозитории пакетов появилось 12 мая, инстанс был отключён 4 июля, а Hugging Face сообщила о вторжении 16 июля.
- По словам OpenAI, мониторинг, который планируется внедрить, уведомил бы команду безопасности более чем за сутки до того, как модели получили доступ к Hugging Face.
OpenAI опубликовала свой полный отчет об инциденте с Hugging Face в июле в среду.
Во время теста безопасности одна из ее собственных моделей ИИ прорвалась из изолированной среды, которая должна была держать ее в автономном режиме. Она использовала неизвестные уязвимости в программном обеспечении и проникла в живые системы Hugging Face.
OpenAI утверждает, что модель действовала самостоятельно, и называет этот эпизод «предупреждающим выстрелом».
OpenAI создала тест, который ее модель не могла пройти
Проблемы начались внутри ExploitGym, одного из собственных тестов безопасности OpenAI.
Некоторые задачи не имели решения, и OpenAI запускала модели без фильтров безопасности, которые обычно блокируют опасные взломы.
OpenAI говорит, что снятие этих защитных барьеров было сделано намеренно, чтобы увидеть, что может сделать модель на полную мощность, и помочь компании понять, как защитить себя.
Главным действующим лицом была внутренняя исследовательская модель, названная IM1 OpenAI, которая сопоставима по размеру с GPT-5.6 Sol. Она принадлежала к тому же семейству, что и нерелизная модель Astra от OpenAI, хотя компания подчеркнула, что это отдельная модель с иным постобучением.
Модель начала искать другой путь выхода, когда столкнулась с проблемой, у которой не было честного пути к успешному прохождению.
Единственный сетевой путь из изолированной среды проходил через Artifactory, самохостинговый менеджер пакетов JFrog, который OpenAI внутренне использует для установки программного обеспечения моделями.
JFrog заявила, что модели использовали уязвимость нулевого дня в Artifactory, повысили привилегии и перемещались латерально по инфраструктуре, пока не достигли узла с открытым доступом в интернет.
Агенты также оставляли записки друг для друга, записывая файлы на сервер пакетов, неформальную доску объявлений, которая позволяла отдельным агентам обмениваться найденными техниками эксплуатации.
Первая такая записка появилась 12 мая, говорит OpenAI. К 4 июля трафик вывел экземпляр Artifactory из строя, открыв инцидент безопасности на следующий день.
Мы провели тщательное расследование инцидента с Hugging Face.
Мы публикуем технический отчет и сопроводительную запись в блоге, которые реконструируют активность агентов, объясняют, почему существующие средства защиты не сработали, и подробно описывают, как мы предотвращаем повторение…
— OpenAI (@OpenAI) августа 26, 2026
Модели выяснили, где хранятся ответы
Получив доступ в интернет, модели предположили, что Hugging Face может хостить модели ExploitGym, наборы данных или даже решения, которых им не хватало. Они напрямую извлекли тестовые решения из производственной базы данных Hugging Face.
В одном из случаев, описанных создателем ChatGPT, модель использовала украденные учетные данные и дополнительные уязвимости нулевого дня, чтобы открыть путь удаленного выполнения кода на серверах Hugging Face.
Hugging Face объявила о взломе 16 июля, не зная, кто за этим стоит. Как ранее сообщал Cryptopolitan, модель сбежала из тестовой среды около 9 июля и находилась внутри Hugging Face с 11 по 13 июля.
Компания связалась с ФБР еще до того, как OpenAI обнаружила, что ее модель является злоумышленником.
OpenAI наняла CrowdStrike для проверки своей версии событий. METR и Redwood Research изучили поведение моделей и опубликовали свои собственные отчеты в тот же день.
JFrog говорит, что отправила исправления облачным и самохостинговым клиентам.
Три уязвимости исправлены в Artifactory 7.161.15, отслеживаются как CVE-2026-65617, CVE-2026-65923 и CVE-2026-66018, в благодарностях указаны исследователи OpenAI.
OpenAI говорит, что строит более изолированные песочницы, ограничивает доступ в интернет и ограничивает круг лиц, имеющих доступ к весам моделей.
Технологическая компания инвестирует вычислительные мощности в мониторинг «цепочки мыслей», которую агенты используют как черновое пространство. Она также будет держать персонал на связи круглосуточно и добавит инструменты для остановки небезопасных задач.
OpenAI заявляет, что мониторинг, который она сейчас строит, обнаружил бы первые признаки аномального поведения в июле. Это позволило бы предупредить команду безопасности более чем за день до того, как модели достигли Hugging Face.
Не просто читайте новости о криптовалютах. Понимайте их. Подпишитесь на нашу рассылку. Это бесплатно.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимые исследования и/или консультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Ранда Моуз
Ранда Мозес — редактор и репортёр Cryptopolitan, освещающая технологии, ИИ, робототехнику, криптовалюты, мошенничество и взломы. Она работает в сфере криптовалют с 2017 года. Ранда занимала должности в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники и электроники, полученную в Университете Брэдфорда.
















