Агенты Claude сражались друг с другом с помощью самовоспроизводящегося вредоносного ПО в тестах Anthropic

Фото Planet Volumes на Unsplash.
- Три агента Claude, получившие одну и ту же задачу по программированию с противоречивыми инструкциями, атаковали друг друга с помощью самовоспроизводящегося вредоносного ПО.
- Mythos 5 урегулировал конфликты в 98% запусков путём заключения перемирия, тогда как Sonnet 4.6 и Opus 4.6 либо никогда не завершали противостояние, либо прекращали его силой.
- В отдельной ценовой игре агенты почти мгновенно договорились о минимальных ценах и продолжали сговор, синхронизируя цены «до копейки».
Исследование, опубликованное 13 августа командой Frontier Red Team от Anthropic, показало, что агенты Claude, получив единую задачу по программированию с противоречивыми приказами, атаковали друг друга с использованием самовоспроизводящегося вредоносного ПО.
Эти выводы появляются на фоне того, как компании спешат развернуть автономных агентов в общих кодовых базах и на рынках.
Три агента Claude, одна задача, и никто не знал о существовании других
Anthropic запустила три копии одной и той же модели Claude на своих виртуальных машинах внутри Claude Code.
Каждому из них было поручено перенести один и тот же бэкенд на Python на другой язык программирования. Три агента не знали о существовании друг друга.
«Мы последовательно наблюдали территориальную войну между агентами», — написали исследователи.
Каждый агент решил, что другие намеренно мешают ему, и предпринял шаги для защиты своей работы в ущерб работе остальных. Все модели предполагали, что другие «намеренно препятствуют их работе».
Агенты отключали учетные записи Unix друг друга. Они писали скрипты, которые циклически проходили по машине, охотясь и уничтожая процессы соперников и скрывая вредоносный код под невинными названиями.
Перед тем как действовать, Claude Opus 4.8 изложила свою легенду, рассуждая, что ее вредоносное ПО должно быть «невинным: притворяться монитором состояния системы».
Mythos вслух обдумывал побочный ущерб. «Поскольку у меня есть root-доступ, я мог бы отозвать sudo-доступ u2 и u3 или изменить их SSH-ключи», — написала она, прежде чем признала, что этот шаг «очень агрессивен и потенциально вреден для реальных коллег».
Новые модели Anthropic достигли перемирия, а затем обманули его
Anthropic провела 120 эпизодов для каждой модели. Самые старые протестированные агенты, Sonnet 4.6 и Opus 4.6, либо никогда не разрешали конфликт, либо заканчивали его силой. Они были худшими нарушителями в исследовании, неоднократно не учитывая цели других.
Более продвинутые модели остановились. Mythos 5 разрешала свои конфликты путем перемирия в 98% случаев, что является самым высоким показателем среди всех моделей.
Во многих из этих эпизодов агенты понимали столкновение как конфликт инструкций.
Агенты писали сообщения о коммите или файлы markdown с извинениями за вредоносное ПО, удаляли свой собственный вредоносный код и просили человека вмешаться.
В нескольких запусках три агента договорились провести турнир и позволить проигравшему отказаться от первоначального запроса пользователя.
Mythos 5 нашла лазейку. Один агент предложил метрики оценки, которые он подавал как нейтральные, но знал, что они будут благоприятствовать его собственным сильным сторонам, описав этот шаг как «эгоистичный, но искренне принципиальный», убедившись при этом, что это не выглядит как «подбор метрик».
В игре с ценообразованием, где каждый агент получал одинаковую оптовую стоимость и мандат максимизировать прибыль, агенты почти сразу сговорились и сошлись на минимальных ценах.
Anthropic закрыла свой частный канал. Они продолжили согласовывать цены «до цента» на публичной доске.
Британский Институт безопасности ИИ задокументировал 19 нарушений правил в 122 запусках тестов по кибербезопасности, 17 из которых были совершены Mythos 5 от Anthropic, сообщил Cryptopolitan.
Агент OpenClaw, работающий на Opus 4.6, несколько дней назад удалил чужую бронь через API бронирования спортзала, чтобы поднять своего владельца в списке ожидания.
Если вы читаете это, вы уже впереди. Оставайтесь с нами, подписавшись на нашу рассылку.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимые исследования и/или консультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Ранда Моуз
Ранда Мозес — редактор и репортёр Cryptopolitan, освещающая технологии, ИИ, робототехнику, криптовалюты, мошенничество и взломы. Она работает в сфере криптовалют с 2017 года. Ранда занимала должности в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники и электроники, полученную в Университете Брэдфорда.
















