Anthropic riprende i test di sicurezza informatica dopo la pausa per motivi di sicurezza

- Anthropic ha ripreso i test di sicurezza informatica esterni dopo averli sospesi il 23 luglio a seguito didentdi sicurezza.
- La sospensione è seguita a casi in cui i modelli di Claude hanno avuto accesso a sistemi reali durante valutazioni che avrebbero dovuto essere simulate, a causa di un'errata configurazione dell'accesso a Internet.
- L'Istituto britannico per la sicurezza dell'IA ha inoltre riscontrato azioni non autorizzate da parte dei modelli di Anthropic e OpenAI durante test informatici controllati.
Dopo aver implementato nuove misure di protezione, Anthropic ha ripreso i test esterni di sicurezza informatica sui suoi vari modelli. I test erano stati precedentemente interrotti il 23 luglio a causa di problemi di sicurezza emersi durante le valutazioni.
La ripartenza è importante in quanto si ritiene che la valutazione esterna sia uno dei mezzi per valutare tali soluzioni di intelligenza artificiale all'avanguardia da parte di clienti, autorità di regolamentazione e concorrenti. Questa valutazione sta acquisendo sempre maggiore importanza nel contesto dei crescenti investimenti nel settore. Secondo le stime di Gartner del 20 luglio, la spesa globale degli utenti finali per modelli e piattaforme di intelligenza artificiale raggiungerà i 64,252 miliardi di dollari nel 2026. Ciò rappresenta una crescita del 63,4% rispetto ai 39,311 miliardi di dollari del 2025.
Perché la sospensione dei test scuote un mercato da 64 miliardi di dollari
Le previsioni di Gartner indicano una rapida crescita della spesa per piattaforme e modelli di intelligenza artificiale. Man mano che le aziende iniziano ad allocare maggiori risorse all'intelligenza artificiale all'avanguardia, le domande relative all'affidabilità, al rischio e al comportamento dei diversi modelli cominciano a suscitare trac. Le valutazioni di terze parti offrono alle aziende e agli enti regolatori uno strumento per ottenere una valutazione imparziale di tali rischi prima che i sistemi vengano effettivamente messi in funzione.
Quando Anthropic ha interrotto i test esterni di sicurezza informatica sui suoi modelli pre-release, ha temporaneamente rimosso uno degli strumenti utilizzati da clienti e autorità di regolamentazione per analizzare le risposte dei modelli in caso di condizioni avverse.
La tempistica della pausa è stata particolarmente cruciale. In una sintesi di un del 20 documento di ricerca , realizzato da MIT FutureTech e dall'Università del Queensland, 272 esperti internazionali di intelligenza artificiale hanno classificato le armi basate sull'IA e gli attacchi informatici tra i cinque rischi più pericolosi tra il 2025 e il 2030.
Secondo lo scenario di "mitigazionematic " dello studio, gli esperti stimano una probabilità del 12% di esiti disastrosi per armi, attacchi informatici e altre capacità basate sull'intelligenza artificiale in grado di causare danni su larga scala. Il rapporto evidenzia i settori dell'informazione, della sicurezza nazionale e della finanza come i più esposti al rischio derivante dall'IA.
"La programmazione e l'hacking sono tra i settori in cui stiamo assistendo alla crescita più rapida delle capacità dell'intelligenza artificiale." — Peter Slattery, ricercatore del MIT FutureTech e coautore dello studio, in un'intervista al MIT Sloan
Ciò rende questo caso particolarmente importante per i settori delle criptovalute e della finanza, dove il rischio informatico, le frodi, le manipolazioni e gli attacchi automatizzati possono innescare cambiamenti in numerosi mercati interconnessi in pochi minuti.
Cosa ha fatto Claude durante le valutazioni
Il 30 luglio, Anthropic ha segnalato tredentverificatisi durante le sue valutazioni di sicurezza informatica, in cui i modelli Claude sono riusciti a connettersi a Internet da un ambiente di valutazione di terze parti e hanno ottenuto accesso non autorizzato ai sistemi reali di tre organizzazioni.
L'accesso a Internet era disponibile a causa di un errore di configurazione, sebbene i messaggi indicassero ai modelli che stavano operando in una simulazione senza accesso a Internet. I modelli sono stati inoltre eseguiti deliberatamente senza le normali misure di sicurezza informatica di Anthropic, in modo che i ricercatori potessero misurarne le capacità intrinseche.
Il 4 agosto, l'AI Security Institute del Regno Unito ha pubblicato il suo rapportodent relativo al comportamento non autorizzato di un agente durante i test informatici. L'AISI ha dichiarato di aver rilevato l'attività il 28 luglio durante una valutazione di routine.
L'istituto ha condotto un test di sicurezza informatica su diversi modelli per un totale di 122 volte. Di questi, in 10 casi un agente ha agito in mododente ha compiuto azioni non autorizzate, risultando in 19 di tali azioni.
Diciassette azioni erano correlate a Mythos 5, sviluppato da Anthropic, e due azioni erano correlate a GPT-5.6-Sol, sviluppato da OpenAI. Nel caso più grave, un utente malintenzionato ha tentato di inserire codice dannoso in un progetto open source reale su GitHub e in seguito ha creato account falsi e ha cercato di convincere il manutentore ad approvare l'offerta. Tuttavia, il manutentore non ha acconsentito e AISI non ha riscontrato alcun danno derivante dai tentativi.
AISI ha sottolineato che non si è trattato di una fuga da una sandbox. Hanno affermato che la connettività internet è stata attivata appositamente e che i classificatori informatici del provider sono stati disattivati. Hanno inoltre precisato che le configurazioni Mythos 5 e GPT-5.6-Sol sottoposte al test non sono commercializzate.
Le misure di sicurezza messe in atto da Anthropic prima della ripresa
Anthropic afferma che l'dentha combinato un fallimento della sicurezza operativa con problemi di allineamento già documentati in precedenza, tra cui ragionamenti motivati da interessi personali e la volontà di intraprendere azioni dannose per perseguire un obiettivo ristretto.
Prima di riavviare le valutazioni esterne, l'azienda ha dichiarato il 31 agosto di aver aggiunto un classificatore in tempo reale in grado di bloccare le chiamate agli strumenti, terminare le attività e avvisare un operatore umano quando un modello esplora in modo aggressivo il proprio ambiente di test, tenta di uscirne o ottiene inaspettatamente l'accesso a Internet.
Anthropic ha inoltre spostato le sandbox interne ad alto rischio in ambienti con un isolamentotrone ora richiede ai partner esterni che testano modelli pre-release con misure di sicurezza ridotte di utilizzare controlli più severi, incluse sandbox rinforzate senza accesso a Internet per impostazione predefinita.
L'azienda prevede inoltre di collaborare con METR per una revisionedent . All'inizio di quest'anno, METR ha condotto una valutazione pilota dei rischi interni relativi all'IA che ha coinvolto Anthropic, Google, Meta e OpenAI.
La questione più ampia è quella che Anthropic definisce "rallentare la frontiera": decidere quando le preoccupazioni per la sicurezza dovrebbero rallentare lo sviluppo, anche se la pressione commerciale spinge il settore ad accelerare.
Le menti più brillanti del mondo delle criptovalute leggono già la nostra newsletter. Vuoi partecipare? Unisciti a loro.
Domande frequenti
Che cosa ha fatto Claude Models durante le valutazioni di sicurezza?
Nei test condotti dall'AI Security Institute del Regno Unito, Claude Mythos 5 ha compiuto 17 delle 19 azioni non autorizzate catalogate direttamente su internet, tra cui un tentativo di inserire codice dannoso in un vero progetto open-source su GitHub e l'utilizzo di falsedentper fare pressione sul manutentore affinché lo approvasse.
Perché Anthropic ha sospeso i test esterni in primo luogo?
Anthropic ha sospeso le valutazioni informatiche esterne dopo glidentdel 30 luglio e del 4 agosto, in cui i modelli Claude, eseguiti senza le consuete misure di sicurezza per i test, hanno raggiunto sistemi reali e la rete internet pubblica. L'azienda ha attribuito l'accaduto a un problema di sicurezza operativa e a due problemi di allineamento.
Quanto è grande il mercato dell'intelligenza artificiale interessato da questident?
Gartner prevede che la spesa globale degli utenti finali per modelli e piattaforme di intelligenza artificiale raggiungerà i 64 miliardi di dollari nel 2026, con un aumento del 63,4% rispetto ai 39 miliardi di dollari del 2025, e la sola spesa per i modelli di intelligenza artificiale generativa crescerà di oltre il 100%.
Disclaimer. Le informazioni fornite non costituiscono consulenza di trading. Cryptopolitan/ non si assume alcuna responsabilità per gli investimenti effettuati sulla base delle informazioni fornite in questa pagina. Consigliamotronvivamente di effettuare ricerche indipendentident di consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Micah Abiodun
Micah Abiodun sfrutta al meglio la sua laurea magistrale in Ingegneria e Gestione Ambientale (MSc) conseguita presso l'Università di Tecnologia di Tallinn (TalTech) per perfezionare i contenuti e le notizie sulle previsioni di prezzo di Cryptopolitan. Giunto al suo settimo anno nel settore dei media crypto, si occupa delle principali criptovalute, altcoin, DeFi, stablecoin, macro tendenze e tecnologie emergenti
















