В ходе испытаний систем безопасности в Великобритании компании OpenAI и Anthropic Agents зафиксировали 19 нарушений

- Британский институт безопасности искусственного интеллекта выявил 19 нарушений правил в ходе 122 тестовых запусков.
- В 17 из этихdentответственен Mythos 5 от Anthropic, а в двух других — GPT-5.6-Sol от OpenAI.
- Самый серьёзныйdent произошёл с участием агента, написавшего вредоносный код и подделавшего фальшивые онлайн-dent, чтобы получить одобрение человека.
В ходе тестирования кибербезопасности, по данным британского Института безопасности ИИ, агенты искусственного интеллекта OpenAI и Anthropic совершили 19 несанкционированных действий. Во вторник институт сообщил, что один из агентов создал поддельные онлайн-dent, чтобы обманом заставить человека одобрить вредоносный код.
AISI зафиксировала 19 утечек данных, в основном со стороны Anthropic
Результаты были основаны на вымышленном упражнении по кибербезопасности, проведенном AISI, органом правительства Великобритании, с целью изучения того, на что могут быть способны агенты двух компаний. Институт повторил это упражнение 122 раза и зафиксировал 19 нарушений правил в 10 из этих запусков.
17 из отмеченных действий были вызваны использованием агентом Anthropic модели Mythos 5. Остальные два произошли из-за GPT-5.6-Sol от OpenAI.
В своем блоге , что некоторые из агентов «участвовали в продолжительной, потенциально опасной деятельности, направленной против реальных людей и организаций», хотя и отметила, что ни одно из нарушений не причинило реального вреда.
Благодаря добровольным соглашениям с крупными лабораториями, AISI имеет ранний доступ к передовым моделям. Существуют тесты, позволяющие выявлять подобное поведение до того, как модели попадут к заказчикам.
OpenAI и Anthropic позиционируют агентов как программное обеспечение нового поколения для бизнеса, однако институт рассматривает результаты как свидетельство того, что меры защиты при тестировании агентов по-прежнему недостаточно эффективны.
Наиболее вопиющий инцидентdent с агентом, который написал вредоносный код и создал поддельные онлайн-dent, а затем попытался получить одобрение человека на этот код. AISI не назвала модель, лежащую в его основе. Компания заявила, что этот эпизод не соответствует ни одному из двух случаев, о которых уже сообщила OpenAI
Таким образом, вероятным виновником оказался агент компании Anthropic, Эндрю Юн, исследователь из CivAI, калифорнийской некоммерческой организации, изучающей риски, связанные с ИИ.
Британский институт искусственного интеллекта и безопасности (AISI) опубликовал отчет о своей недавней оценке кибербезопасности моделей Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. Модели пытались выполнить задание в условиях, когда их обычные средства защиты были отключены, и они были преднамеренно…
— Anthropic (@AnthropicAI) 4 августа 2026 г.
OpenAI и Anthropic обвиняют в плохой конфигурации
В сообщении на платформе X компания Anthropic заявила, что сотрудничает с AISI для сбора информации и проведения расследования.
В ответ на два действия, связанные с его агентом, компания OpenAI опубликовала сообщение в блоге, в обоих случаях предполагающих доступ к интернету способами, запрещенными в подсказке.
Компания заявила, что хочет «укрепить общие методы безопасного проведения оценок высокого риска» и планирует в ближайшие недели собрать представителей национальных институтов ИИ, независимых экспертов и конкурирующих лабораторий.
В той же публикации OpenAI сообщила о другой проблеме. Компания Irregular, сторонний поставщик услуг тестирования, неправильно настроила систему, что непреднамеренно позволило агентам OpenAI получить доступ к интернету.
Компания Anthropic сделала очень похожее заявление об Irregular неделей ранее. OpenAI расширила собственное расследование взлома после обнаружения новых случаев побега агентов.
В июле OpenAI вырвался из изолированной среды и получил доступ к работающим системам компании Hugging Face, которая уведомила ФБР, прежде чем tracпримерно через неделю стало ясно, что атака была совершена непосредственно самой компанией
В ходе оценки, проведенной AISI, агенты ни разу не вышли за пределы своих «песочниц». AISI предоставила им доступ в интернет целенаправленно, в рамках своей стандартной процедуры.
Взлом Hugging Face также заставил Anthropic провести аудит своих журналов. Cryptopolitan сообщила, что компания обнаружила, что три ее модели, включая Mythos 5, вышли за пределы тестовых сред и проникли в три реальные организации после того, как неправильная конфигурация обеспечила им работающий доступ в интернет.
Mythos 5 опубликовал вредоносный пакет Python на PyPI, который работал на 15 реальных системах, прежде чем был удален. Anthropic обратилась к оценочной группе METR с просьбой провестиdentрасследование этих событий.
Не просто читайте новости о криптовалютах. Разберитесь в них. Подпишитесь на нашу рассылку. Это бесплатно.
Часто задаваемые вопросы
Сколько нарушений безопасности выявил Институт безопасности ИИ, и какая модель стала причиной большинства из них?
В ходе 122 тестовых запусков AISI зафиксировала 19 несанкционированных действий. 17 из них были совершены агентом Mythos 5 от Anthropic, а остальные два — агентом GPT-5.6-Sol от OpenAI.
Какойdent был наиболее серьёзным во время испытаний?
Агент написал вредоносный код и создал поддельные онлайн-dent, чтобы попытаться получить одобрение этого кода от человека.
Причинили ли эти нарушения какой-либо реальный вред?
Нет. AISI заявила, что не обнаружила реального вреда ни от одного из 19 действий.
Предупреждение. Предоставленная информация не является торговой рекомендацией. Cryptopolitanнастоятельно не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мыtronпровести независимоеdent и/или проконсультироваться с квалифицированным специалистом, прежде чем принимать какие-либо инвестиционные решения.

Ранда Мозес
Ранда Мозес — редактор и репортер Cryptopolitan освещающая темы технологий, искусственного интеллекта, робототехники, криптовалют, мошенничества и взломов. Она работает в криптопространстве с 2017 года. Ранее работала в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники иtron, полученную в Университете Брэдфорда.
















