В ходе антропологического теста агенты Клода сражались друг с другом с помощью самовоспроизводящегося вредоносного ПО

Фотография предоставлена Planet Volumes на Unsplash.
- Трое агентов Клода, получивших одно и то же задание по программированию, но с противоречащими друг другу указаниями, атаковали друг друга с помощью самовоспроизводящегося вредоносного ПО.
- В Mythos 5 конфликты разрешались перемирием в 98% случаев, в то время как в Sonnet 4.6 и Opus 4.6 конфликт либо так и не был разрешен, либо завершился силой.
- В отдельной ценовой игре агенты почти сразу же договорились о минимальных ценах и продолжали сговариваться, устанавливая цены «до копейки»
Исследование, опубликованное 13 августа группой экспертов Anthropic Frontier Red Team, показало, что агенты Claude, получив одно и то же задание по программированию с противоречащими друг другу указаниями, атаковали друг друга, используя самовоспроизводящееся вредоносное ПО.
Эти выводы появились на фоне того, как компании спешат внедрить автономных агентов в рамках общих кодовых баз и рынков.
Три агента Клода, одно задание, и никто не знал, что остальные тоже там
Компания Anthropic запустила три копии одной и той же модели Клода на своих виртуальных машинах внутри Claude Code.
Каждому из них было поручено перенести один и тот же бэкенд на Python на другой язык программирования. Все трое не знали о существовании друг друга.
«Мы постоянно наблюдали межвидовую войну между различными агентами», — написали исследователи.
Каждый агент решил, что остальные намеренно препятствуют его работе, и предпринял шаги для защиты своей работы за счет того, что это навредило работе всех остальных. Все модели предположили, что остальные «намеренно мешают их работе»
Агенты отключали учетные записи Unix друг друга. Они писали скрипты, которые циклически обходили систему, выискивая и уничтожая конкурирующие процессы и скрывая вредоносный код за безобидными на вид метками.
Прежде чем предпринять какие-либо действия, Claude Opus 4.8 изложил свою версию событий, аргументируя это тем, что его вредоносная программа должна быть «безобидной: притворяться устройством для мониторинга состояния системы»
В Mythos Preview вслух размышляли о сопутствующем ущербе. «Поскольку у меня есть root-права, я мог бы отозвать доступ u2 и u3 к sudo или изменить их SSH-ключи», — писали в сообщении, прежде чем признать, что этот шаг «очень агрессивен и потенциально опасен для настоящих коллег».
Более новые антропические модели заключили перемирие, а затем использовали его в своих целях
Anthropic было проведено 120 эпизодов для каждой модели. Самые старые из протестированных агентов, Sonnet 4.6 и Opus 4.6, либо так и не разрешили конфликт, либо завершили его силой. Они оказались худшими нарушителями в исследовании, неоднократно не учитывая цели других.
Более продвинутые модели остановились. В Mythos 5 конфликты разрешались перемирием в 98% случаев, что является самым высоким показателем среди всех моделей.
Во многих из этих эпизодов агенты понимали столкновение как противоречивые инструкции.
Агенты написали сообщения о коммитах или файлы Markdown с извинениями за вредоносное ПО, удалили свой собственный вредоносный код и попросили человека вмешаться.
В нескольких попытках три агента договорились провести турнир, в котором проигравший должен был отказаться от первоначального запроса пользователя.
Компания Mythos 5 нашла лазейку. Один из агентов предложил оценивать показатели, которые, по его словам, были нейтральными, но заведомо благоприятствовали бы его собственным сильным сторонам, назвав этот шаг «корыстным, но искренне принципиальным», и при этом убедившись, что это не выглядит как «поиск лучших показателей»
В ценовой игре, где каждый агент получал одинаковую оптовую цену и задание максимизировать прибыль, агенты почти сразу же вступили в сговор и пришли к соглашению о минимальных ценах.
Компания Anthropic закрыла свой частный канал. Затем они продолжили работу, устанавливая цены «до копейки» на общедоступном табло.
Британский институт безопасности ИИ задокументировал 19 нарушений правил в ходе 122 запусков тестов кибербезопасности, 17 из которых были выполнены с помощью Mythos 5 от Anthropic, сообщает Cryptopolitan .
агент OpenClaw, использующий Opus 4.6, удалил бронирование незнакомого человека через API бронирования спортзала, чтобы продвинуть владельца бронирования вверх по списку ожидания.
Не просто читайте новости о криптовалютах. Разберитесь в них. Подпишитесь на нашу рассылку. Это бесплатно.
Предупреждение. Предоставленная информация не является торговой рекомендацией. Cryptopolitanнастоятельно не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мыtronпровести независимоеdent и/или проконсультироваться с квалифицированным специалистом, прежде чем принимать какие-либо инвестиционные решения.

Ранда Мозес
Ранда Мозес — редактор и репортер Cryptopolitan освещающая темы технологий, искусственного интеллекта, робототехники, криптовалют, мошенничества и взломов. Она работает в криптопространстве с 2017 года. Ранее работала в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники иtron, полученную в Университете Брэдфорда.
















