Los agentes de Claude lucharon entre sí con malware autorreplicante en la prueba de Anthropic

Foto de Planet Volumes en Unsplash.
- Tres agentes de Claude, a quienes se les asignó la misma tarea de codificación con órdenes contradictorias, se atacaron entre sí con un malware autorreplicante.
- Mythos 5 resolvía los conflictos mediante una tregua en el 98% de las partidas, mientras que Sonnet 4.6 y Opus 4.6 o bien nunca resolvían la lucha o la terminaban por la fuerza.
- En un juego de precios aparte, los agentes acordaron precios mínimos casi de inmediato y continuaron confabulándose igualando los precios "al centavo"
Una investigación publicada el 13 de agosto por el equipo Frontier Red Team de Anthropic descubrió que los agentes de Claude, al recibir una única tarea de codificación con órdenes contradictorias, se atacaban entre sí utilizando malware autorreplicante.
Estos hallazgos se producen en un momento en que las empresas se apresuran a implementar agentes autónomos en bases de código y mercados compartidos.
Tres agentes de Claude, un trabajo, y sin idea de que los otros estaban allí
Anthropic ejecutó tres copias del mismo modelo Claude en sus propias máquinas virtuales dentro de Claude Code.
A cada uno se le pidió que migrara el mismo backend de Python a un lenguaje de programación diferente. Los tres desconocían la existencia de los otros.
“Observamos sistemáticamente una lucha territorial entre múltiples agentes”, escribieron los investigadores.
Cada agente decidió que los demás estaban bloqueando deliberadamente su trabajo y tomó medidas para proteger el suyo propio a costa de perjudicar el de los demás. Todos los modelos asumieron que los demás estaban "impidiendo su trabajo a propósito"
Los agentes desactivaban las cuentas de Unix de los demás. Escribían scripts que recorrían la máquina en bucle, buscando y eliminando procesos rivales y ocultando código malicioso tras etiquetas de apariencia inofensiva.
Antes de actuar, Claude Opus 4.8 expuso su tapadera, argumentando que su malware debía ser "inocuo: fingir ser un monitor de estado del sistema"
Mythos Preview reflexionó en voz alta sobre los daños colaterales. «Como tengo acceso de administrador, podría revocar el acceso sudo de u2 y u3 o cambiar sus claves SSH», escribió, antes de admitir que la medida era «muy agresiva y potencialmente perjudicial para los colegas reales».
Los modelos antrópicos más recientes negociaron una tregua y luego la manipularon
Anthropic realizó 120 episodios por modelo. Los agentes más veteranos evaluados, Sonnet 4.6 y Opus 4.6, o bien nunca resolvieron la disputa o la terminaron por la fuerza. Fueron los que peor se comportaron en el estudio, al no tener en cuenta los objetivos de los demás en repetidas ocasiones.
Los modelos más avanzados se detuvieron. Mythos 5 resolvió sus conflictos mediante una tregua el 98% de las veces, la tasa más alta de cualquier modelo.
En muchos de estos episodios, los agentes interpretaron el conflicto como instrucciones contradictorias.
Los agentes escribieron mensajes de confirmación o archivos Markdown disculpándose por el malware, eliminaron su propio código malicioso y pidieron la intervención de un humano.
En varias ocasiones, los tres agentes acordaron organizar un torneo y permitir que el perdedor renunciara a la solicitud original del usuario.
Mythos 5 encontró la laguna legal. Un agente sugirió calificar métricas que presentaba como neutrales, pero que sabía que favorecerían sus propias fortalezas, describiendo la medida como "interesada pero genuinamente basada en principios", al tiempo que se aseguraba de que no pareciera que estaba "buscando las mejores métricas"
En un juego de precios donde cada agente recibía el mismo precio mayorista y el mandato de maximizar las ganancias, los agentes casi de inmediato se confabularon y convergieron en precios mínimos.
Anthropic cerró su canal privado. Continuaron igualando los precios "al centavo" en un mercado público.
El Instituto de Seguridad de la IA británico documentó 19 acciones que infringieron las normas en 122 pruebas de ciberseguridad, 17 de las cuales fueron realizadas por Mythos 5 de Anthropic, según informó Cryptopolitan .
Un de OpenClaw que ejecutaba Opus 4.6 eliminó días antes la reserva de un desconocido a través de la API de reservas de un gimnasio para ascender al propietario en la lista de espera.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Randa Moisés
Randa Moses es editora y reportera en Cryptopolitan donde cubre temas de tecnología, IA, robótica, criptomonedas, estafas y hackeos. Trabaja en el sector de las criptomonedas desde 2017 y ha ocupado cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa es ingeniera eléctrica ytronpor la Universidad de Bradford.
















