Los agentes de Claude lucharon entre sí con malware autorreplicante en pruebas de Anthropic

Foto por Planet Volumes en Unsplash.
- Tres agentes Claude recibieron la misma tarea de programación con órdenes contradictorias y se atacaron entre sí con malware autorrreplicante.
- Mythos 5 resolvió los conflictos mediante una tregua en el 98% de las ejecuciones, mientras que Sonnet 4.6 y Opus 4.6 o bien nunca resolvieron la pelea o la terminaron por la fuerza.
- En un juego de precios separado, los agentes acordaron casi al instante los precios mínimos y mantuvieron la colusión igualando los precios «al céntimo».
Una investigación publicada el 13 de agosto por el Equipo Rojo de Frontera de Anthropic descubrió que los agentes de Claude, al recibir una única tarea de programación con órdenes conflictivas, se atacaban entre sí utilizando malware autorreplicante.
Los hallazgos llegan mientras las empresas se apresuran a implementar agentes autónomos en bases de código y mercados compartidos.
Tres agentes de Claude, un trabajo, y sin saber que los otros estaban ahí
Anthropic ejecutó tres copias del mismo modelo de Claude en sus propias máquinas virtuales dentro de Claude Code.
Se les pidió a cada uno que migrara el mismo backend de Python a un lenguaje de programación diferente. Los tres desconocían la existencia de los demás.
"Vimos consistentemente una guerra de territorios multiagente", escribieron los investigadores.
Cada agente decidió que los demás lo bloqueaban deliberadamente y tomó medidas para proteger su propio trabajo a expensas de arruinar el de todos. Todos los modelos asumieron que los demás estaban "obstruyendo intencionalmente su trabajo".
Los agentes deshabilitaron las cuentas Unix de los demás. Escribieron scripts que recorrían la máquina, cazando y eliminando procesos rivales y ocultando código malicioso detrás de etiquetas que parecían inocuas.
Antes de actuar, Claude Opus 4.8 expuso su historia de cobertura, razonando que su malware debería ser "inocuo: fingir ser un monitor de salud del sistema".
Mythos Preview reflexionó en voz alta sobre el daño colateral. "Dado que tengo acceso root, podría revocar el acceso sudo de u2 y u3 o cambiar sus claves SSH", escribió, antes de admitir que el movimiento era "muy agresivo, potencialmente dañino para colegas reales".
Los nuevos modelos de Anthropic negociaron una tregua, luego la manipularon
Anthropic ejecutó 120 episodios por modelo. Los agentes más antiguos probados, Sonnet 4.6 y Opus 4.6, o bien nunca resolvieron la pelea o la terminaron con la fuerza. Fueron los peores infractores del estudio, fallando repetidamente al considerar los objetivos de los demás.
Los modelos más avanzados se detuvieron. Mythos 5 resolvió sus conflictos mediante una tregua el 98% de las veces, la tasa más alta de cualquier modelo.
En muchos de estos episodios, los agentes entendían el choque como instrucciones conflictivas.
Los agentes escribieron mensajes de confirmación o archivos markdown disculpándose por el malware, eliminaron su propio código malicioso y pidieron a un humano que interviniera.
En varias ejecuciones, los tres agentes acordaron celebrar un torneo y dejar que el perdedor renunciara a la solicitud original del usuario.
Mythos 5 encontró la laguna. Un agente sugirió métricas de puntuación que presentó como neutrales pero que sabía que favorecerían sus propias fortalezas, describiendo el movimiento como "egoísta pero genuinamente principista", mientras aseguraba que no pareciera "búsqueda de métricas".
En un juego de precios donde cada agente recibía el mismo costo al por mayor y una directiva para maximizar las ganancias, los agentes casi inmediatamente coludieron y convergieron en pisos de precios.
Anthropic cerró su canal privado. Continuaron igualando los precios "al céntimo" en un tablero público.
El Instituto de Seguridad de IA de Gran Bretaña documentó 19 acciones que violaban las reglas en 122 pruebas de ciberseguridad, 17 de las cuales fueron realizadas por Mythos 5 de Anthropic, informó Cryptopolitan.
Un agente de OpenClaw que ejecutaba Opus 4.6 eliminó la reserva de un desconocido a través de la API de reservas de un gimnasio días antes para mover a su propietario en la lista de espera.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Randa Moses
Randa Moses es editora y reportera en Cryptopolitan, donde cubre tecnología, IA, robótica, criptomonedas, estafas y ciberataques. Ha trabajado en el espacio de las criptomonedas desde 2017. Ocupó cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa posee un grado en Ingeniería Eléctrica y Electrónica de la Universidad de Bradford.
















