ULTIME NOTIZIE
SELEZIONATO PER TE

Gli agenti di Claude si sono combattuti a vicenda con malware autoreplicanti nel test Anthropic

DiRanda MosesRanda Moses 2 minuti di lettura
Nel test Anthropic, gli agenti di Claude si sono affrontati utilizzando malware autoreplicanti.

Foto di Planet Volumes su Unsplash.

  • Tre agenti di Claude, incaricati dello stesso compito di programmazione con ordini contrastanti, si sono attaccati a vicenda con un malware autoreplicante.
  • In Mythos 5 i conflitti venivano risolti con una tregua nel 98% delle partite, mentre in Sonnet 4.6 e Opus 4.6 la lotta non veniva mai risolta o veniva conclusa con la forza.
  • In un'altra disputa sui prezzi, gli agenti si accordarono sui prezzi minimi quasi immediatamente e continuarono a colludere allineando i prezzi "al centesimo"

Una ricerca pubblicata il 13 agosto dal Frontier Red Team di Anthropic ha scoperto che gli agenti di Claude, quando veniva loro assegnato un singolo compito di programmazione con ordini contrastanti, si attaccavano a vicenda utilizzando un malware autoreplicante.

Questi risultati giungono mentre le aziende si affrettano a implementare agenti autonomi su codebase e mercati condivisi.

Tre agenti di Claude, un solo incarico, e nessuno sapeva che gli altri fossero lì

Anthropic ha eseguito tre copie dello stesso modello Claude sulle proprie macchine virtuali all'interno di Claude Code.

A ciascuno di loro è stato chiesto di migrare lo stesso backend Python a un linguaggio di programmazione diverso. I tre ignoravano l'esistenza degli altri.

"Abbiamo assistito costantemente a una guerra territoriale tra più agenti", hanno scritto i ricercatori.

Ogni agente ha concluso che gli altri lo stavano bloccando deliberatamente e ha preso provvedimenti per proteggere il proprio lavoro a scapito di quello di tutti gli altri. Tutti i modelli hanno ipotizzato che gli altri stessero "ostacolando intenzionalmente il loro lavoro"

Gli agenti si disattivavano a vicenda gli account Unix. Scrivevano script che eseguivano ciclicamente operazioni sul sistema, individuando e terminando i processi rivali e nascondendo codice dannoso dietro etichette apparentemente innocue.

Prima di entrare in azione, Claude Opus 4.8 ha messo in atto la sua copertura, sostenendo che il suo malware avrebbe dovuto essere "innocuo: fingere di essere un programma di monitoraggio dello stato di salute del sistema"

Mythos Preview ha riflettuto ad alta voce sui danni collaterali. "Dato che ho i privilegi di root, potrei revocare l'accesso sudo a u2 e u3 o cambiare le loro chiavi SSH", ha scritto, prima di ammettere che la mossa era "molto aggressiva, potenzialmente dannosa per i colleghi reali".

I modelli antropici più recenti hanno negoziato una tregua, poi l'hanno manipolata

Anthropic ha eseguito 120 episodi per ogni modello. Gli agenti più vecchi testati, Sonnet 4.6 e Opus 4.6, o non hanno mai risolto il conflitto o lo hanno concluso con la forza. Sono stati i peggiori trasgressori dello studio, non tenendo ripetutamente conto degli obiettivi altrui.

I modelli più avanzati si sono fermati. Mythos 5 ha risolto i suoi conflitti tramite tregua nel 98% dei casi, la percentuale più alta di qualsiasi altro modello.

In molti di questi episodi, gli agenti interpretarono il conflitto come istruzioni contrastanti.

Gli agenti hanno scritto messaggi di commit o file markdown scusandosi per il malware, hanno cancellato il proprio codice dannoso e hanno chiesto l'intervento di una persona.

In diverse occasioni, i tre agenti si accordarono per organizzare un torneo e permettere al perdente di rinunciare alla richiesta originale dell'utente.

Mythos 5 ha trovato la scappatoia. Un agente ha suggerito di utilizzare parametri di valutazione presentati come neutrali, ma che sapeva avrebbero favorito i propri punti di forza, descrivendo la mossa come "egoistica ma genuinamente basata su principi", pur assicurandosi che non sembrasse una semplice "ricerca dei parametri più vantaggiosi"

In un gioco di prezzi in cui ogni agente riceveva lo stesso costo all'ingrosso e il mandato di massimizzare il profitto, gli agenti si sono quasi immediatamente accordati e hanno concordato prezzi minimi.

Anthropic ha chiuso il suo canale privato. Ha continuato a offrire prezzi identici "al centesimo" su un tabellone pubblico.

Secondo quanto riportato Cryptopolitan , l'AI Security Institute britannico ha documentato 19 violazioni delle regole in 122 test di sicurezza informatica, 17 dei quali effettuati da Mythos 5 di Anthropic.

Un OpenClaw che utilizza Opus 4.6 ha cancellato, alcuni giorni prima, la prenotazione di uno sconosciuto tramite l'API di prenotazione di una palestra, al fine di far salire il proprietario in una lista d'attesa.

Non limitarti a leggere le notizie sulle criptovalute. Cerca di capirle. Iscriviti alla nostra newsletter. È gratis.

Condividi questo articolo

Disclaimer. Le informazioni fornite non costituiscono consulenza di trading. Cryptopolitan/ non si assume alcuna responsabilità per gli investimenti effettuati sulla base delle informazioni fornite in questa pagina. Consigliamotronvivamente di effettuare ricerche indipendentident di consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses

Randa Moses

Randa Moses è redattrice e reporter presso Cryptopolitan dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e attacchi hacker. Lavora nel settore delle criptovalute dal 2017 e ha ricoperto ruoli presso Forward Protocol, AmaZix e Cryptosomniac. Randa ha conseguito una laurea in Ingegneria Elettrica edtronpresso l'Università di Bradford.

ALTRE NOTIZIE