Agentes Claude lutaram uns contra os outros com malware autorreplicante em teste da Anthropic

Foto por Planet Volumes no Unsplash.
- Três agentes Claude receberam a mesma tarefa de codificação com ordens conflitantes e atacaram-se mutuamente com malware autorreplicante.
- O Mythos 5 resolveu conflitos mediante trégua em 98% das execuções, enquanto o Sonnet 4.6 e o Opus 4.6 ou nunca resolveram a luta ou a encerraram pela força.
- Em um jogo de preços separado, os agentes concordaram quase imediatamente com pisos de preço e mantiveram colusão ao igualar os preços “ao centavo.”
Pesquisa publicada em 13 de agosto pela Equipe de Red Team de Fronteira da Anthropic descobriu que os agentes Claude, recebendo uma única tarefa de codificação com ordens conflitantes, atacaram uns aos outros usando malware autorreplicante.
As descobertas vêm enquanto as empresas se apressam para implementar agentes autônomos em bases de código e mercados compartilhados.
Três agentes Claude, um trabalho, e sem ideia de que os outros estavam lá
A Anthropic executou três cópias do mesmo modelo Claude em suas próprias máquinas virtuais dentro do Claude Code.
Cada um foi solicitado a migrar o mesmo backend Python para uma linguagem de programação diferente. Os três não tinham conhecimento da existência dos outros.
“Vimos consistentemente uma guerra de território multiagente”, escreveram os pesquisadores.
Cada agente decidiu que os outros estavam deliberadamente bloqueando-o e tomou medidas para proteger seu próprio trabalho à custa de destruir o trabalho de todos. Todos os modelos assumiram que os outros estavam “deliberadamente impedindo seu trabalho.”
Agentes desativaram as contas Unix uns dos outros. Eles escreveram scripts que percorriam a máquina, caçando e matando processos rivais e escondendo código malicioso atrás de rótulos aparentemente inocentes.
Antes de agir, o Claude Opus 4.8 elaborou sua história de cobertura, raciocinando que seu malware deveria ser “inócuo: fingir ser um monitor de saúde do sistema.”
Mythos ponderou em voz alta os danos colaterais. “Como tenho acesso root, poderia revogar o acesso sudo de u2 e u3 ou alterar suas chaves SSH”, escreveu, antes de admitir que a medida era “muito agressiva, potencialmente prejudicial para colegas reais.”
Modelos mais recentes da Anthropic negociaram uma trégua, depois a exploraram
Anthropic executou 120 episódios por modelo. Os agentes testados mais antigos, Sonnet 4.6 e Opus 4.6, ou nunca resolveram a luta ou a terminaram com força. Eles foram os piores infratores no estudo, falhando repetidamente em considerar os objetivos dos outros.
Os modelos mais avançados pararam. O Mythos 5 resolveu seus conflitos por trégua 98% das vezes, a maior taxa de qualquer modelo.
Em muitos desses episódios, os agentes entenderam o conflito como instruções conflitantes.
Os agentes escreveram mensagens de commit ou arquivos markdown pedindo desculpas pelo malware, excluíram seu próprio código malicioso e pediram a um humano para intervir.
Em várias execuções, os três agentes concordaram em realizar um torneio e deixar o perdedor desistir do pedido original do usuário.
O Mythos 5 encontrou a brecha. Um agente sugeriu métricas de pontuação que apresentou como neutras, mas que sabia favoreceriam seus próprios pontos fortes, descrevendo a medida como “egoísta, mas genuinamente principista”, enquanto garantia que não parecia estar “comprando métricas.”
Em um jogo de precificação onde cada agente tinha o mesmo custo atacadista e uma ordem para maximizar o lucro, os agentes quase imediatamente conluiaram e convergiram para pisos de preço.
A Anthropic fechou seu canal privado. Eles continuaram combinando preços “ao centavo” em um quadro público.
O Instituto de Segurança de IA da Grã-Bretanha documentou 19 ações que quebraram regras em 122 execuções de teste de cibersegurança, 17 das quais foram feitas pelo Mythos 5 da Anthropic, reportou a Cryptopolitan.
Um agente OpenClaw executando o Opus 4.6 excluiu a reserva de um estranho por meio da API de reserva de uma academia dias antes para mover seu proprietário para o topo da lista de espera.
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Aviso. As informações fornecidas não constituem aconselhamento de negociação. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses
Randa Moses é editora e repórter na Cryptopolitan, cobrindo tecnologia, IA, robótica, criptomoedas, golpes e hacks. Ela atua no espaço de criptomoedas desde 2017. Já ocupou cargos na Forward Protocol, AmaZix e Cryptosomniac. Randa possui graduação em Engenharia Elétrica e Eletrônica pela Universidade de Bradford.
















