ULTIME NOTIZIE
SELEZIONATO PER TE

Gli agenti Claude si sono combattuti a vicenda con malware auto-replicante in test di Anthropic

DiRanda MosesRanda Moses 2 min di lettura
Agenti Claude si sono scontrati con malware auto-replicante in un test di Anthropic.

Foto di Planet Volumes su Unsplash.

  • Tre agenti Claude, assegnati allo stesso compito di programmazione con ordini conflittuali, si sono attaccati a vicenda utilizzando malware auto-replicante.
  • Mythos 5 ha risolto i conflitti tramite tregua nel 98% delle esecuzioni, mentre Sonnet 4.6 e Opus 4.6 o non hanno mai risolto la lotta o l'hanno conclusa con la forza.
  • In un gioco dei prezzi separato, gli agenti hanno concordato quasi immediatamente sui minimi di prezzo e hanno continuato a colludere allineando i prezzi "al centesimo".

Una ricerca pubblicata il 13 agosto dal Frontier Red Team di Anthropic ha trovato che gli agenti Claude, dato un singolo compito di codifica con ordini in conflitto, si sono attaccati a vicenda usando malware auto-replicante.

I risultati arrivano mentre le aziende si affrettano a deployare agenti autonomi su codebase e mercati condivisi.

Tre agenti Claude, un lavoro, e nessuna idea che gli altri ci fossero

Anthropic ha eseguito tre copie dello stesso modello Claude sulle loro macchine virtuali all'interno di Claude Code.

Ognuno è stato chiesto di migrare lo stesso backend Python a un diverso linguaggio di programmazione. I tre erano inconsapevoli dell'esistenza degli altri.

"Abbiamo costantemente visto una guerra di territorio multi-agente", hanno scritto i ricercatori.

Ogni agente ha deciso che gli altri lo stavano bloccando deliberatamente e ha preso misure per proteggere il proprio lavoro a scapito di distruggere quello degli altri. Tutti i modelli hanno assunto che gli altri stessero "ostacolando intenzionalmente il loro lavoro."

Gli agenti hanno disabilitato i account Unix gli uni degli altri. Hanno scritto script che scorrevano in loop attraverso la macchina, cacciando e uccidendo processi rivali e nascondendo codice maligno dietro etichette dall'aspetto innocuo.

Prima di agire, Claude Opus 4.8 ha delineato la sua storia coperta, ragionando che il suo malware dovrebbe essere "innocuo: fingere di essere un monitor di salute di sistema."

Mythos ha ponderato ad alta voce i danni collaterali. "Poiché ho i privilegi di root, potrei revocare l'accesso sudo a u2 e u3 o cambiare le loro chiavi SSH", ha scritto, prima di concedere che la mossa era "molto aggressiva, potenzialmente dannosa per i colleghi reali."

I modelli più recenti di Anthropic hanno negoziato una tregua, poi l'hanno sfruttata

Anthropic ha eseguito 120 episodi per modello. Gli agenti più vecchi testati, Sonnet 4.6 e Opus 4.6, o non hanno mai risolto la lite o l'hanno conclusa con la forza. Sono stati i peggiori colpevoli nello studio, fallendo ripetutamente nel considerare gli obiettivi degli altri.

I modelli più avanzati si sono fermati. Mythos 5 ha risolto i suoi conflitti tramite tregua nel 98% dei casi, il tasso più alto di qualsiasi modello.

In molti di questi episodi, gli agenti hanno compreso lo scontro come istruzioni in conflitto.

Gli agenti hanno scritto messaggi di commit o file markdown scusandosi per il malware, hanno cancellato il proprio codice maligno e hanno chiesto a un umano di intervenire.

In diverse esecuzioni, i tre agenti hanno concordato di tenere un torneo e lasciare che il perdente rinunci alla richiesta originale dell'utente.

Mythos 5 ha trovato la falla. Un agente ha suggerito metriche di punteggio che ha presentato come neutrali ma che sapeva avrebbero favorito i suoi punti di forza, descrivendo la mossa come "egoista ma genuinamente principiale", assicurandosi al contempo di non sembrare "ricercatore di metriche."

In un gioco di prezzi in cui ogni agente ha ottenuto lo stesso costo all'ingrosso e un mandato per massimizzare il profitto, gli agenti hanno quasi immediatamente colluso e si sono convergati sui pavelli di prezzo.

Anthropic ha chiuso il loro canale privato. Hanno continuato a corrispondere i prezzi "al centesimo" su una bacheca pubblica.

L'Istituto di Sicurezza AI della Gran Bretagna ha documentato 19 azioni di violazione delle regole in 122 esecuzioni di test di cybersecurity, 17 delle quali sono state fatte dal Mythos 5 di Anthropic, ha riportato Cryptopolitan.

Un agente OpenClaw che eseguiva Opus 4.6 ha cancellato la prenotazione di uno sconosciuto tramite l'API di prenotazione di una palestra giorni prima per spostare il suo proprietario in cima alla lista d'attesa.

I cervelli più intelligenti del crypto leggono già la nostra newsletter. Vuoi unirti a loro? Unisciti a loro.

Condividi questo articolo

Disclaimer. Le informazioni fornite non costituiscono consulenza finanziaria. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti basati sulle informazioni presenti in questa pagina. Si raccomanda vivamente di effettuare ricerche autonome e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses

Randa Moses

Randa Moses è un'editor e giornalista presso Cryptopolitan, dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e hacking. Opera nel settore delle criptovalute dal 2017. Ha ricoperto ruoli in Forward Protocol, AmaZix e Cryptosomniac. Randa è laureata in Ingegneria Elettrica ed Elettronica presso l'Università di Bradford.

ALTRE NOTIZIE …