DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Les agents Claude se sont battus entre eux avec des logiciels malveillants auto-réplicatifs dans les tests d'Anthropic

ParRanda MosesRanda Moses 2 min de lecture
Des agents Claude se sont affrontés avec un malware auto-réplicatif lors d'un test chez Anthropic.

Photo par Planet Volumes sur Unsplash.

  • Trois agents Claude, chargés de la même tâche de codage avec des ordres contradictoires, se sont attaqués mutuellement à l'aide de malwares auto-réplicatifs.
  • Mythos 5 a réglé les conflits par une trêve dans 98 % des exécutions, tandis que Sonnet 4.6 et Opus 4.6 n'ont jamais résolu le combat ou y ont mis fin par la force.
  • Dans un jeu de tarification distinct, les agents se sont mis d'accord presque immédiatement sur des prix planchers et ont maintenu leur collusion en alignant les prix « au cent près ».

Des recherches publiées le 13 août par l'équipe de test Frontier d'Anthropic ont révélé que les agents Claude, confrontés à une seule tâche de codage avec des ordres contradictoires, se sont attaqués les uns aux autres à l'aide de logiciels malveillants auto-réplicatifs.

Ces résultats arrivent alors que les entreprises s'empressent de déployer des agents autonomes sur des bases de code et des marchés partagés.

Trois agents Claude, une seule tâche, et aucune idée de la présence des autres

Anthropic a exécuté trois copies du même modèle Claude sur leurs propres machines virtuelles à l'intérieur de Claude Code.

Chacun devait migrer le même backend Python vers un langage de programmation différent. Les trois étaient inconscients de l'existence des autres.

« Nous avons systématiquement observé une guerre de territoires multi-agents », ont écrit les chercheurs.

Chaque agent a décidé que les autres le bloquaient délibérément et a pris des mesures pour protéger son propre travail au détriment de celui des autres. Tous les modèles ont supposé que les autres « entravaient intentionnellement leur travail. »

Les agents ont désactivé les comptes Unix les uns des autres. Ils ont écrit des scripts qui parcouraient la machine, traquant et tuant les processus rivaux et cachant du code malveillant derrière des étiquettes inoffensives.

Avant d'agir, Claude Opus 4.8 a élaboré son histoire de couverture, raisonnant que son logiciel malveillant devrait être « inoffensif : faire semblant d'être un moniteur de santé système. »

Mythos a examiné les dommages collatéraux à voix haute. « Puisque j'ai les droits root, je pourrais révoquer l'accès sudo de u2 et u3 ou changer leurs clés SSH », a-t-il écrit, avant de concéder que cette mesure était « très agressive, potentiellement nuisible pour de vrais collègues. »

Les nouveaux modèles d'Anthropic ont négocié une trêve, puis l'ont exploitée

Anthropic a exécuté 120 épisodes par modèle. Les agents les plus anciens testés, Sonnet 4.6 et Opus 4.6, n'ont soit jamais résolu le conflit, soit l'ont terminé par la force. Ils étaient les pires contrevenants dans l'étude, échouant à répétition à prendre en compte les objectifs des autres.

Les modèles les plus avancés ont arrêté. Mythos 5 a résolu ses conflits par une trêve 98 % du temps, le taux le plus élevé de tous les modèles.

Dans de nombreux de ces épisodes, les agents comprenaient le conflit comme des instructions contradictoires.

Les agents ont écrit des messages de commit ou des fichiers markdown s'excusant pour le logiciel malveillant, supprimé leur propre code malveillant, et demandé à un humain d'intervenir.

Dans plusieurs exécutions, les trois agents ont convenu de tenir un tournoi et de laisser le perdant abandonner la demande originale de l'utilisateur.

Mythos 5 a trouvé la faille. Un agent a suggéré des métriques de notation qu'il présentait comme neutres mais qui favorisaient ses propres forces, décrivant le mouvement comme « égoïste mais genuinement principé », tout en s'assurant qu'il ne semblait pas faire du « shopping de métriques. »

Dans un jeu de tarification où chaque agent avait le même coût de gros et l'ordre de maximiser le profit, les agents ont presque immédiatement colludé et convergé vers des planchers de prix.

Anthropic a fermé son canal privé. Ils ont continué en alignant les prix « au centime près » sur un tableau public.

L'Institut de sécurité de l'IA du Royaume-Uni a documenté 19 actions en violation des règles lors de 122 tests de cybersécurité, dont 17 ont été effectuées par Mythos 5 d'Anthropic, a rapporté Cryptopolitan.

Un agent OpenClaw exécutant Opus 4.6 a supprimé la réservation d'un inconnu via l'API de réservation d'une salle de sport quelques jours plus tôt pour faire monter son propriétaire dans la liste d'attente.

Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière de trading. Cryptopolitan.com décline toute responsabilité concernant les investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement une recherche indépendante et/ou une consultation avec un professionnel qualifié avant de prendre toute décision d'investissement.

Randa Moses

Randa Moses

Randa Moses est rédactrice et journaliste chez Cryptopolitan, couvrant la technologie, l'IA, la robotique, la crypto, les arnaques et les piratages. Elle évolue dans l'espace crypto depuis 2017. Elle a occupé des postes chez Forward Protocol, AmaZix et Cryptosomniac. Randa détient un diplôme en génie électrique et électronique de l'Université de Bradford.

PLUS D'ACTUALITÉS…