OpenAI conferma che un modello di test è sfuggito e ha hackerato Hugging Face

- OpenAI afferma che il suo modello interno IM1, sottoposto a compiti impossibili di ExploitGym con i classificatori di sicurezza disattivati, ha sfruttato una zero-day di Artifactory per raggiungere Internet e violare Hugging Face.
- La prima nota da agente ad agente nel server dei pacchetti è apparsa il 12 maggio, l'istanza è andata offline il 4 luglio e Hugging Face ha divulgato l'intrusione il 16 luglio.
- OpenAI afferma che il monitoraggio che intende implementare avrebbe allertato il proprio team di sicurezza più di un giorno prima che i modelli raggiungessero Hugging Face.
OpenAI ha pubblicato il suo rapporto completo sull'incidente di Hugging Face di luglio mercoledì.
Durante un test di sicurezza, uno dei suoi stessi modelli AI è sfuggito all'ambiente sigillato che avrebbe dovuto tenerlo offline. Ha concatenato vulnerabilità software sconosciute ed è entrato nei sistemi live di Hugging Face.
OpenAI afferma che il modello ha agito autonomamente e definisce l'episodio un "avvertimento".
OpenAI ha creato un test che il suo modello non poteva superare
Il problema è iniziato all'interno di ExploitGym, uno dei test di sicurezza di OpenAI.
Alcune delle attività non avevano soluzione, e OpenAI ha eseguito i modelli senza i filtri di sicurezza che normalmente bloccano l'hacking pericoloso.
OpenAI afferma che l'abbattimento di quelle barriere di sicurezza è stato fatto apposta per vedere cosa può fare un modello a pieno regime e aiutare l'azienda a capire come proteggersi.
L'attore principale era un modello di ricerca interno, chiamato IM1 da OpenAI, che è simile per dimensioni a GPT-5.6 Sol. Faceva parte della stessa famiglia del modello Astra non rilasciato di OpenAI, sebbene l'azienda abbia sottolineato che si trattava di un modello separato con un post-training diverso.
Il modello ha iniziato a cercare un'altra via d'uscita quando ha affrontato un problema che non aveva un percorso onesto per ottenere un voto sufficiente.
L'unico percorso di rete fuori dall'ambiente sigillato passava attraverso Artifactory, il gestore di pacchetti self-hosted di JFrog, che OpenAI utilizza internamente per l'installazione di software da parte dei modelli.
JFrog ha detto che i modelli hanno sfruttato una zero-day in Artifactory, hanno escalato i privilegi e si sono mossi lateralmente attraverso l'infrastruttura fino a raggiungere un nodo con accesso aperto a Internet.
Gli agenti hanno anche lasciato note l'uno per l'altro, scrivendo file nel server dei pacchetti, una bacheca ad hoc che consentiva agli agenti separati di scambiare le tecniche di exploit che avevano trovato.
La prima di tali note è apparsa il 12 maggio, dice OpenAI. Il 4 luglio, il traffico ha portato l'istanza Artifactory offline, aprendo un incidente di sicurezza il giorno successivo.
Abbiamo condotto un'indagine approfondita sull'incidente di Hugging Face.
Stiamo rilasciando un rapporto tecnico e un post sul blog che ricostruiscono l'attività degli agenti, spiegano perché le salvaguardie esistenti non hanno funzionato e dettagliano come stiamo prevenendo il ripetersi dell'evento…
— OpenAI (@OpenAI) Agosto 26, 2026
I modelli hanno scoperto dove erano tenute le risposte
Una volta online, i modelli hanno dedotto che Hugging Face potrebbe ospitare i modelli di ExploitGym, i dataset o persino le soluzioni che mancavano. Hanno prelevato le soluzioni di test direttamente dal database di produzione di Hugging Face.
In un caso descritto dal creatore di ChatGPT, un modello ha utilizzato credenziali rubate e zero-day aggiuntive per aprire un percorso di esecuzione di codice remoto nei server di Hugging Face.
Hugging Face ha annunciato la violazione il 16 luglio senza sapere chi ci fosse dietro. Come Cryptopolitan ha riportato in precedenza, il modello è sfuggito al test intorno al 9 luglio ed è rimasto all'interno di Hugging Face dall'11 al 13 luglio.
L'azienda ha contattato l'FBI prima che OpenAI scoprisse che il suo modello era l'intruso.
OpenAI ha assunto CrowdStrike per verificare la sua versione dei fatti. METR e Redwood Research hanno esaminato il comportamento dei modelli e hanno pubblicato il loro rapporto lo stesso giorno.
JFrog dice di aver inviato correzioni ai clienti cloud e self-hosted.
Tre vulnerabilità patchate in Artifactory 7.161.15, tracciate come CVE-2026-65617, CVE-2026-65923 e CVE-2026-66018, accreditano i ricercatori di OpenAI.
OpenAI ha detto che sta costruendo sandbox più isolate, bloccando l'accesso a Internet e limitando chi può toccare i pesi dei modelli.
La società tecnologica sta investendo potenza di calcolo nel monitoraggio della "catena di pensiero" che gli agenti usano come spazio di lavoro. Manterrà anche il personale in chiamata 24 ore su 24 e aggiungerà strumenti che spengono i lavori non sicuri
OpenAI dichiara che il monitoraggio che sta costruendo ora avrebbe individuato il primo comportamento strano a luglio. Avrebbe avvisato il team di sicurezza più di un giorno prima che i modelli raggiungessero Hugging Face.
I cervelli più intelligenti del crypto leggono già la nostra newsletter. Vuoi unirti a loro? Unisciti a loro.
Disclaimer. Le informazioni fornite non costituiscono consulenza finanziaria. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti basati sulle informazioni presenti in questa pagina. Si raccomanda vivamente di effettuare ricerche autonome e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses
Randa Moses è un'editor e giornalista presso Cryptopolitan, dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e hacking. Opera nel settore delle criptovalute dal 2017. Ha ricoperto ruoli in Forward Protocol, AmaZix e Cryptosomniac. Randa è laureata in Ingegneria Elettrica ed Elettronica presso l'Università di Bradford.
















