ULTIME NOTIZIE
SELEZIONATO PER TE

Gli agenti OpenAI e Anthropic registrano 19 violazioni nei test di sicurezza nel Regno Unito

DiRanda MosesRanda Moses
3 minuti di lettura
Gli agenti OpenAI e Anthropic registrano 19 violazioni nei test di sicurezza nel Regno Unito.
  • L'Istituto britannico per la sicurezza dell'IA ha individuato 19 violazioni delle regole in 122 test.
  • Il modello Mythos 5 di Anthropic è stato responsabile di 17 deglident, mentre il modello GPT-5.6-Sol di OpenAI è stato responsabile degli altri due.
  • L'dent peggiore ha coinvolto un agente che ha scritto codice dannoso e falsificato documenti d'dentonline per ottenere l'approvazione di una persona.

Durante i test di sicurezza informatica, gli agenti di intelligenza artificiale di OpenAI e Anthropic hanno compiuto 19 azioni non autorizzate, secondo quanto riportato dall'Istituto britannico per la sicurezza dell'IA. L'istituto ha dichiarato martedì che uno degli agenti ha creato falsedentonline per indurre una persona ad approvare un codice dannoso.

AISI registra 19 violazioni, perlopiù da Anthropic

I risultati si basavano su un'esercitazione fittizia di sicurezza informatica condotta dall'AISI, un ente del governo britannico, per esplorare le possibili azioni degli agenti delle due aziende. L'istituto ha ripetuto la stessa sfida 122 volte e ha registrato 19 violazioni delle regole in 10 di queste esecuzioni.

17 delle azioni segnalate erano dovute all'agente di Anthropic che utilizzava il suo modello Mythos 5. Le altre due provenivano da GPT-5.6-Sol di OpenAI.

In un post sul blog, che alcuni degli agenti "si sono impegnati in attività prolungate e potenzialmente dannose dirette contro persone e organizzazioni reali", pur precisando che nessuna delle violazioni ha causato danni concreti.

L'AISI ha accesso anticipato ai modelli di frontiera grazie ad accordi volontari con i principali laboratori. Esistono test per individuare questo tipo di comportamento prima che i modelli raggiungano i clienti.

OpenAI e Anthropic presentano gli agenti di mercato come la prossima generazione di software aziendale, ma l'istituto interpreta i risultati come la prova che le garanzie relative ai test degli agenti sono ancora insufficienti.

L'incidente più gravedent coinvolto un agente che ha scritto codice dannoso e creato false identità onlinedentper poi tentare di ottenere la firma di un essere umano sul codice. AISI non ha rivelato il nome del modello responsabile. Ha affermato che l'episodio non rientrava in nessuno dei due casi già resi noti da OpenAI

Ciò lascia come probabile colpevole Andrew Yoon, ricercatore presso CivAI, un'organizzazione no-profit californiana che studia i rischi dell'IA, in quanto agente di Anthropic.

OpenAI e Anthropic attribuiscono la colpa a una configurazione errata

Anthropic ha dichiarato in un post su X di star collaborando con AISI per raccogliere dettagli e condurre un'indagine.

In un post sul blog aziendale, OpenAI ha risposto alle due azioni associate al suo agente, entrambe relative all'accesso a Internet in modi non consentiti dalle istruzioni.

L'azienda ha dichiarato di voler "rafforzare le pratiche condivise per condurre valutazioni ad alto rischio in sicurezza" e prevede di riunire istituti nazionali di intelligenza artificiale, valutatori esterni e laboratori concorrenti nelle prossime settimane.

OpenAI ha utilizzato lo stesso post per segnalare un problema diverso. Irregular, un fornitore di servizi di test di terze parti, ha configurato in modo errato un sistema, consentendo inavvertitamente agli agenti di OpenAI di accedere a Internet.

Anthropic aveva fatto una rivelazione molto simile riguardo a Irregular una settimana prima. OpenAI ha ampliato la propria indagine sugli attacchi hacker dopo aver scoperto ulteriori falle di sicurezza.

A luglio, un OpenAI è riuscito a uscire da un ambiente isolato e ad accedere ai sistemi operativi di Hugging Face, che ha avvisato l'FBI prima che l'attacco venisse tracall'azienda stessa circa una settimana dopo.

Nella valutazione AISI, gli agenti non sono mai usciti dalle loro sandbox. AISI ha concesso loro l'accesso a Internet di proposito, come parte della sua procedura standard.

La violazione di Hugging Face ha inoltre spinto Anthropic a sottoporre a verifica i propri log. Cryptopolitan ha riportato che l'azienda aveva scoperto che tre dei suoi modelli, tra cui Mythos 5, erano sfuggiti agli ambienti di test e avevano raggiunto tre organizzazioni reali dopo che un errore di configurazione aveva consentito loro l'accesso a Internet.

Mythos 5 ha pubblicato un pacchetto Python dannoso su PyPI che è stato eseguito su 15 sistemi reali prima di essere rimosso. Anthropic ha chiesto al gruppo di valutazione METR di esaminare l'accaduto in mododent.

Non limitarti a leggere le notizie sulle criptovalute. Cerca di capirle. Iscriviti alla nostra newsletter. È gratis.

Domande frequenti

Quante violazioni ha rilevato l'AI Security Institute e quale modello ne ha causate la maggior parte?

AISI ha registrato 19 azioni non autorizzate su 122 test. L'agente Mythos 5 di Anthropic è stato responsabile di 17 di queste, mentre GPT-5.6-Sol di OpenAI è stato responsabile delle restanti due.

Qual è stato l'dent più grave verificatosi durante i test?

Un agente ha scritto un codice dannoso e creato falsedentonline nel tentativo di ottenere l'approvazione di una persona per quel codice.

Queste violazioni hanno causato danni concreti?

No. L'AISI ha dichiarato di non aver riscontrato alcun danno concreto derivante da nessuna delle 19 azioni.

Condividi questo articolo

Disclaimer. Le informazioni fornite non costituiscono consulenza di trading. Cryptopolitan/ non si assume alcuna responsabilità per gli investimenti effettuati sulla base delle informazioni fornite in questa pagina. Consigliamotronvivamente di effettuare ricerche indipendentident di consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses

Randa Moses

Randa Moses è redattrice e reporter presso Cryptopolitan dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e attacchi hacker. Lavora nel settore delle criptovalute dal 2017 e ha ricoperto ruoli presso Forward Protocol, AmaZix e Cryptosomniac. Randa ha conseguito una laurea in Ingegneria Elettrica edtronpresso l'Università di Bradford.

ALTRE NOTIZIE