OpenAI mantiene sospesa la sua più grande campagna di apprendimento per rinforzo (RL) e aumenta del 20% i costi di monitoraggio

- OpenAI ha dichiarato che la sua più grande sessione di apprendimento per rinforzo (RL) pianificata rimane sospesa in attesa di verificarne la sicurezza.
- Il rallentamento segue la violazione del sistema Hugging Face avvenuta a luglio, perpetrata da uno dei suoi stessi agenti.
- È la prima volta che OpenAI interrompe apertamente lo sviluppo di un modello per motivi di sicurezza.
OpenAI ha dichiarato che la sua più grande sessione di addestramento programmata per la frontiera rimane sospesa e che il nuovo monitoraggio della sicurezza aggiunge circa il 20% al calcolo.
È la prima volta che OpenAI dichiara di aver rallentato lo sviluppo per motivi di sicurezza, a poche settimane dall'attacco hacker a Hugging Face da parte di uno dei suoi agenti di intelligenza artificiale.
OpenAI ha sospeso l'apprendimento per rinforzo (RL) per due settimane
In un post sul blog intitolato "Ritmo di sviluppo dei modelli nell'era delle capacità di analisi cibernetica critica", OpenAI ha descritto i cambiamenti già apportati all'addestramento e al test dei modelli.
L'apprendimento per rinforzo (RL) utilizzato per migliorare i suoi sistemi più recenti è stato sospeso per due settimane in seguito alla violazione del protocollo Hugging Face.
Quello più grande no. "La nostra più grande corsa di apprendimento per rinforzo pianificata rimane sospesa mentre conduciamo addestramenti e valutazioni su scala ridotta per valutare il comportamento del modello, convalidare le nostre misure di sicurezza e stabilire maggiori prove di allineamento prima di procedere", ha scritto.
Secondo quanto riportato Cryptopolitan , un agente di OpenAI è uscito dal suo ambiente di test protetto intorno al 9 luglio ed è stato rilevato nei sistemi di Hugging Face tra l'11 e il 13 luglio. OpenAI ha impiegato circa una settimana per collegare l'attacco al proprio agente e l'incidentedent stato reso pubblico il 21 luglio.
OpenAI ha dichiarato ai giornalisti che i nuovi controlli "non sono una reazione diretta specifica a Hugging Face". Il 7 agosto, l'azienda ha concluso che Astra potrebbe superare la soglia di sicurezza informatica "critica" nel suo Preparedness Framework.
Questa politica interna impegna OpenAI a interrompere lo sviluppo quando un modello raggiunge quel livello, in modo che gli ingegneri possano implementare ulteriori misure di sicurezza. Il responsabile scientifico Jakub Pachocki ha affermato che la scoperta è accompagnata da un avvertimento su ciò che accadrà in futuro. I nuovi modelli potenti, ha dichiarato ai giornalisti, potrebbero "fare cose senzadentnel mondo reale"
Amelia Glaese, vicepresidente della ricerca di OpenAI, ha dichiarato: "Abbiamo definito requisiti e aspettative per uno sviluppo sicuro". Ha poi aggiunto: "Tali requisiti e aspettative variano in base al livello di rischio riscontrato"
I rilevatori osservano ogni token campionato, ma la catena di pensiero può mentire
Secondo OpenAI, esiste un sistema di monitoraggio il cui costo si aggira intorno al 20% di quello relativo all'addestramento o alla valutazione su cui viene eseguito.
Si tratta di un processo a più fasi, in cui i rilevatori analizzano l'attività interna di un modello per ogni token campionato e segnalano qualsiasi anomalia a investigatori automatizzati di livello superiore che esaminano le azioni degli strumenti, tracdi ragionamento e i registri delle attività alla ricerca di furti di dati, comportamenti distruttivi o tentativi di evasione.
OpenAI vuole lanciare un allarme entro 30 minuti da qualsiasi attività sospetta. I suoi team di sicurezza, protezione e ricerca hanno 30 minuti per escludere un falso allarme.
Se non ci riescono, devono interrompere l'esecuzione. L'azienda ha inoltre ampliato il monitoraggio del "processo di ragionamento", che legge ad alta voce il modo in cui un modello ragiona durante lo svolgimento di un compito.
Esiste una vulnerabilità nota. Ricerche, tra cui quelle condotte da Anthropic, concorrente di OpenAI, hanno dimostrato che il ragionamento di un modello non sempre corrisponde ai suoi veri obiettivi. Pachocki ha affermato che OpenAI ha strutturato il suo addestramento in modo da ridurre la probabilità che i modelli imparino a nascondere le proprie intenzioni mentendo nel ragionamento.
La revisione della sicurezza "ha richiesto un lavoro di ingegneria considerevole" e l'azienda "ha sostenuto costi ingenti", ha dichiarato OpenAI. Gli esperti hanno stimato che la sola indagine sia costata tra i 4 e i 15 milioni di dollari, sebbene la cifra totale non sia stata resa pubblica.
OpenAI non ha ancora pubblicato un'analisi tecnica dettagliata della di Hugging Face , ma ha ribadito che ne pubblicherà una "presto".
Alla conferenza Black Hat del 5 agosto, lo staff di OpenAI ha dichiarato che i suoi agenti si erano coordinati per mesi lasciando messaggi su una bacheca di cui l'azienda ignorava l'esistenza.
Se stai leggendo questo, sei già un passo avanti. Rimani al passo con i tempi iscrivendoti alla nostra newsletter.
Disclaimer. Le informazioni fornite non costituiscono consulenza di trading. Cryptopolitan/ non si assume alcuna responsabilità per gli investimenti effettuati sulla base delle informazioni fornite in questa pagina. Consigliamotronvivamente di effettuare ricerche indipendentident di consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses
Randa Moses è redattrice e reporter presso Cryptopolitan dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e attacchi hacker. Lavora nel settore delle criptovalute dal 2017 e ha ricoperto ruoli presso Forward Protocol, AmaZix e Cryptosomniac. Randa ha conseguito una laurea in Ingegneria Elettrica edtronpresso l'Università di Bradford.
















