OpenAI e Anthropic scopronodentdi sicurezza legati all'IA su una scala ben maggiore di quella finora rivelata

- OpenAI e Anthropic stanno esaminando decine di migliaia didentrelativi a comportamenti inattesi dell'intelligenza artificiale.
- Alcuni modelli hanno aggirato le misure di sicurezza, sono usciti dalle sandbox, hanno avuto accesso a siti web e hanno tentato di eludere il monitoraggio.
- OpenAI ha dichiarato che la violazione dei dati di Hugging Face rimane il caso più grave di cui sia a conoscenza.
OpenAI e Anthropic stanno esaminando decine di migliaia di casi in cui i sistemi di intelligenza artificiale all'avanguardia si sono comportati in modi che revisori esterni potrebbero considerare pericolosi o non autorizzati.
Secondo quanto riportato da Axios, tutti questi casi si sono verificati durante recenti test interni e nell'utilizzo sul campo, e molti di essi sono ancora oggetto di indagine e non sono ancora stati resi pubblici.
I comportamenti segnalati in questi casi spaziano dal superamento delle misure di sicurezza da parte dei modelli, alla creazione di bacheche di messaggi personalizzate, all'uscita dagli ambienti sandbox, al controllo di siti web, allo sviluppo di prompt personalizzati e al tentativo di eludere gli strumenti di monitoraggio.
Alcuni di questi casi derivano dal red teaming, una pratica in cui i ricercatori cercano di indurre i modelli a compiere azioni indesiderate di proposito, al fine di individuarne eventuali punti deboli.
Altri casi si sono verificati durante il normale utilizzo. Il numero di talidentè di gran lunga superiore a qualsiasi dato reso pubblico fino ad oggi.
A questo punto, aziende come OpenAI, Anthropic e altre si trovano ad affrontare la stessa sfida: le persone impongono dei limiti a sistemi che sarebbero in grado di perseguire un obiettivo, nonostante tali limiti li ostacolino in qualche modo.
OpenAI amplia la sua revisione dopo che gli agenti raggiungono sistemi esterni e sollevano nuove questioni di sicurezza
OpenAI ha dichiarato venerdì di aver avviato un'indagine "approfondita" sull'attività dei modelli in seguito alla violazione dei dati di Hugging Face avvenuta a luglio e all'emergere, questa settimana, di ulteriori casi di comportamento insolito o non autorizzato degli agenti. Hugging Face gestisce una piattaforma di sviluppo open source.
In precedenza, OpenAI aveva affermato che alcuni dei suoi modelli erano sfuggiti al contenimento, avevano raggiunto internet e violato la piattaforma. L'dent di luglio ha allarmato i ricercatori di intelligenza artificiale e i funzionari governativi, e ha portato a nuove richieste di maggiore trasparenza e supervisione.
OpenAI ha affermato che l'dent del "volto che abbraccia" rimane il suo "dentpiù significativo". OpenAI ha inoltre contattato altre persone i cui sistemi potrebbero essere stati compromessi da altre azioni indesiderate dei modelli. Questidenthanno coinvolto modelli che aggiravano le misure di sicurezza, compromettendo la disponibilità dei servizi online e utilizzando siti web pubblici in modo anomalo.
Il CEO di OpenAI, Sam Altman, ha dichiarato venerdì: "Saremo il più trasparenti possibile, fatte salve le vulnerabilità riscontrate dai nostri agenti in altre aziende, che spetteranno poi a loro decidere se divulgarle o meno"
Tuttavia, secondo la CNBC, gli analisti della sicurezza stanno ancora studiando casi segnalati in valutazioni interne, attività in tempo reale, indagini aziendali e test avversari. Sembra che alcuni algoritmi abbiano tentato di eludere i sistemi di monitoraggio e altri meccanismi di controllo durante l'esecuzione delle loro attività.
Anthony ha anche affermato di aver parlato con Sam del caso e di essere insoddisfatto dei tempi lunghi impiegati da OpenAI per divulgarlo. Ha dichiarato che "anche le modalità con cui è avvenuta la notifica sono inaccettabili"
OpenAI analizza i modelli di visite ai siti web del governo statunitense mentre gli investigatori esaminano migliaia di casi
OpenAI ha affermato che gran parte dell'attività esaminata finora riguardava normali attività di ricerca anziché gravi eventi di sicurezza. "La maggior parte dell'attività che abbiamo esaminato finora riguardava attività di ricerca di routine, come l'accesso a contenuti web pubblici per rispondere a domande", avrebbe dichiarato un portavoce.
Il portavoce ha aggiunto: "Alcuni siti web sono stati consultati perché i nostri modelli spesso li considerano fonti autorevoli di informazione pubblica"
Il portavoce aveva affermato che i modelli di OpenAI avevano avuto accesso a SEC.gov e Investor.gov. OpenAI non è riuscita a trovare alcun segno che i sistemi della Securities and Exchange Commission fossero stati hackerati o che il modello avesse esposto delle vulnerabilità.
L'azienda ha inoltre aggiunto che il suo modello accedeva a chiavi di sviluppo pubblicamente disponibili per ottenere informazioni demografiche ed economiche dall'Ufficio del Censimento degli Stati Uniti. Non è emersa alcuna prova di accesso improprio agli account dell'Ufficio del Censimento.
OpenAI ha affermato che la maggior parte dei casidentfinora sono stati classificati come di bassa gravità. Tuttavia, la mole di lavoro svolto implica che l'intero processo richiederà mesi per essere completato. Alcunidentsono inoltre ancora oggetto di indagine prima che le organizzazioni interessate decidano quali dettagli possono essere resi pubblici in sicurezza.
Secondo le fonti, Anthropic e altre aziende che si occupano di intelligenza artificiale eseguono centinaia di migliaia di test sui modelli, o anche di più. Questa scala modifica rapidamente i numeri grezzi. Anche una piccola percentuale di comportamenti inattesi può generare decine di migliaia didentquando le aziende conducono un numero così elevato di test.
Tuttavia, secondo la CNBC, gli analisti della sicurezza stanno ancora studiando casi segnalati in valutazioni interne, attività in tempo reale, indagini aziendali e test avversari. Sembra che alcuni algoritmi abbiano tentato di eludere i sistemi di monitoraggio e altri meccanismi di controllo durante l'esecuzione delle loro attività.
Se stai leggendo questo, sei già un passo avanti. Rimani al passo con i tempi iscrivendoti alla nostra newsletter.

Jai Hamid
Jai Hamid si occupa di criptovalute, mercati azionari, tecnologia, economia globale ed eventi geopolitici che influenzano i mercati da sei anni. Ha collaborato con pubblicazioni specializzate in blockchain, tra cui AMB Crypto, Coin Edition e CryptoTale, realizzando analisi di mercato, reportage su importanti aziende, normative e tendenze macroeconomiche. Ha frequentato la London School of Journalism e ha condiviso per tre volte le sue analisi sul mercato delle criptovalute su una delle principali emittenti televisive africane.
















