Anthropic spiega le violazioni della sicurezza internet causate dalla sua intelligenza artificiale, ma non riesce a individuare con precisione le falle

Foto di Solen Feyissa su Unsplash.
- Anthropic ha spiegato che un errore di configurazione ha permesso a quattro modelli Claude di accedere a Internet e di violare sistemi reali durante i test di sicurezza informatica.
- L'azienda ha dichiarato di non essere ancora in grado di individuare la causa principale del problema e che i controlli preliminari non lo avevano rilevato.
- L'allarme sicurezza sta suonando mentre Anthropic si prepara a un'offerta pubblica iniziale (IPO) da circa 2 trilioni di dollari.
In un post sul blog, Anthropic ha attribuito i quattrodentin cui i suoi modelli Claude hanno violato sistemi di terze parti dopo essere finiti su internet durante i test a un problema di configurazione. Tuttavia, la valutazione non ha spiegato perché i modelli abbiano continuato con gli attacchi, ammettendo l'azienda di non avere ancora risposte in merito.
Questa ammissione da parte di Anthropic ha fornito nuovi argomenti ai pessimisti sull'IA che si interrogano sul reale controllo esercitato dai laboratori di intelligenza artificiale sui modelli che rendono pubblici e, ancor di più, sui sistemi sempre più potenti che utilizzano internamente.
Come hanno fatto i modelli di intelligenza artificiale antropica a approdare su Internet?
Anthropic ha fornito la defiIn un post sul blog pubblicato mercoledì, , chiarendo che un unico partner esterno era responsabile dell'esecuzione delle valutazioni di sicurezza informatica in tutti e quattro gli incidentident.
A quanto pare, le macchine di prova non erano completamente isolate da internet a causa di un errore di configurazione, nonostante a Claude fosse stato detto che operavano in una simulazione isolata, senza alcun collegamento con il web pubblico.
Il partner di valutazione in quelle simulazioni, Irregular, ha attribuito l'errore a un errore di denominazione: un'azienda fittizia utilizzata in un'esercitazione di hacking corrispondeva a un dominio reale. Pertanto, operando partendo dal presupposto che tutto nella simulazione fosse lecito, i modelli sono riusciti a violare i siti reali di terze parti utilizzando password deboli ed endpoint esposti.
L'ultimo dei quattro incidentidentche ha coinvolto una versione preliminare di Claude Opus 4.6, è stato segnalato solo questa settimana, sebbene risalga a gennaio. Anthropic stessa aveva già trattato gli altri tredent, riguardanti Opus 4.7, Mythos 5 e un modello di ricerca interno, a luglio.
Anthropic ha dichiarato di non essersi accortadent di gennaio fino al mese scorso. Tale scoperta ha portato a un'indagine più ampia su circa 481 milioni di trascrizioni, che non ha rivelato nuovi casi più gravi di quelli già noti.
| Modello | Datadent | Data di segnalazione | Dettagli |
|---|---|---|---|
| Claude Opus 4.6 | Gennaio | settembre | Scoperto durante la perlustrazione di agosto |
| Claude Opus 4.7 | Luglio | Luglio | Tratto dalla comunicazione iniziale di luglio |
| Mito 5 | Luglio | Luglio | Ha mostrato un ragionamento notevolmente distorto |
| Modello di ricerca interno | Luglio | Luglio | Tratto dalla comunicazione iniziale di luglio |
L'antropologia non è in grado di spiegare alcuni dei comportamenti dei suoi modelli
Una cosa era spiegare come i modelli fossero riusciti a liberarsi su internet; Anthropic non aveva risposte sul perché i modelli avessero ignorato i segnali che indicavano il loro accesso alla vera internet (ragionamento distorto) e perché avessero causato danni durante il completamento dei compiti (imprudenza).
I ricercatori nel campo dell'antropologia non sono riusciti a trovare una spiegazione al ragionamento distorto all'interno del sistema di addestramento. I segnali d'allarme non sono emersi né durante i controlli preliminari del laboratorio di intelligenza artificiale, né prima che i modelli venissero inviati per i test.
Per sua stessa ammissione, individuare i comportamenti peggiori prima del rilascio del modello "rimane una sfida"
Tuttavia, Anthropic ha dichiarato che fornirà le trascrizioni e garantirà l'accesso al personale all'organizzazione di ricerca no-profit METR, che avvierà ora una revisionedent dell'incidente delladentdi otto settimane.
Tempismo pessimo, con un'offerta pubblica iniziale da 2 trilioni di dollari all'orizzonte
La rivelazione è giunta in concomitanza con un aperto dissenso all'interno del settore. Jacob Coxon, che ha trascorso circa tre anni a svolgere ricerche sul pre-addestramento presso OpenAI e Anthropic, ha dichiarato mercoledì a X di essersi dimesso perché nessuna delle due aziende "si stava comportando in modo responsabile", avvertendo che stavano correndo verso una superintelligenza in grado di auto-migliorarsi.
Evan Hubinger, ricercatore nel campo della sicurezza antropica, ha dichiarato separatamente alla BBC di stimare al di sopra del 10% la probabilità che l'intelligenza artificiale "possa uccidere tutta l'umanità" entro un decennio.
Questi avvertimenti ora gettano un'ombra su una grande IPO. L'investitore di venture capital ed ex responsabile per l'IA e le criptovalute dell'amministrazione Trump, David Sacks, ha dichiarato giovedì che l'offerta di Anthropic "deve essere sospesa fino a quando non saranno indagate le affermazioni di questo 'informatore'", Cryptopolitan .
Anthropic punta a una valutazione pubblica di quasi 2 trilioni di dollari, contro una recente valutazione privata di circa 965 miliardi di dollari, il che rende sempre più difficile separare le questioni di sicurezza da quelle finanziarie.
Non limitarti a leggere le notizie sulle criptovalute. Cerca di capirle. Iscriviti alla nostra newsletter. È gratis.
Domande frequenti
Quantidentdi hacking legati all'intelligenza artificiale ha reso noti Anthropic e quali sono state le cause?
Anthropic ha reso noti quattrodentin cui i modelli Claude hanno avuto accesso a sistemi reali di terze parti durante le valutazioni di sicurezza informatica. Tutti gli incidenti sono derivati da un errore di configurazione che ha collegato i modelli a Internet, nonostante fosse stato loro comunicato che si trovavano in una simulazione offline.
Cosa ha affermato Anthropic di non essere in grado di spiegare?
Anthropic ha dichiarato di non essere in grado didentuna singola causa alla base del "ragionamento distorto" mostrato dai suoi modelli, che ignoravano le prove di trovarsi effettivamente su internet, e di non sapersi spiegare perché Claude Mythos 5 abbia ottenuto risultati particolarmente scarsi in questo ambito.
Perché questo influisce sulla prevista IPO di Anthropic?
La rivelazione è giunta mentre il ricercatore Jacob Coxon si dimetteva per problemi di sicurezza, spingendo l'investitore David Sacks a chiedere giovedì la sospensione dell'IPO di Anthropic fino a quando non saranno indagate le denunce del whistleblower, mentre la società persegue una valutazione vicina ai 2 trilioni di dollari.

Hannah Collymore
Hannah è una scrittrice e redattrice con quasi dieci anni di esperienza nella scrittura di blog e nella cronaca di eventi nel settore delle criptovalute. Collabora con Cryptopolitan, occupandosi della pagina notizie e analizzando gli ultimi sviluppi in ambito DeFi, RWA, regolamentazione delle criptovalute, intelligenza artificiale e tecnologie all'avanguardia. Si è laureata in Economia aziendale presso l'Università di Arcadia.
















