ULTIME NOTIZIE
SELEZIONATO PER TE

OpenAI mantiene in pausa il suo più grande run RL frontier, aggiunge un costo di monitoraggio del 20%

DiRanda MosesRanda Moses 2 min di lettura
OpenAI mantiene sospeso il suo più grande run RL frontier e aggiunge costi di monitoraggio del 20%.
  • OpenAI ha dichiarato che la sua più grande esecuzione pianificata di apprendimento per rinforzo (RL) resta in pausa mentre convalida la sicurezza.
  • Il rallentamento segue la violazione di luglio di Hugging Face da parte di uno dei suoi stessi agenti.
  • È la prima volta che OpenAI frena apertamente lo sviluppo dei modelli per motivi di sicurezza.

OpenAI ha dichiarato che il suo più grande run di addestramento frontier programmato rimane in sospeso e che il nuovo monitoraggio di sicurezza aggiunge circa il 20% al calcolo.

È la prima volta che OpenAI dice di aver rallentato lo sviluppo per preoccupazioni di sicurezza, settimane dopo che uno dei suoi agenti AI ha hackerato Hugging Face.

OpenAI ha interrotto l'apprendimento per rinforzo (RL) per due settimane

In un post sul blog intitolato "Pacing model development in an era of cyber-critical capabilities", OpenAI ha descritto i cambiamenti che ha già apportato al suo addestramento e test dei modelli.

L'apprendimento per rinforzo (RL) utilizzato per migliorare i suoi ultimi sistemi è stato interrotto per due settimane dopo la violazione di Hugging Face.

Il grande non l'ha fatto. "Il nostro più grande run RL frontier pianificato rimane in sospeso mentre conduciamo addestramenti e valutazioni su scala più piccola per valutare il comportamento del modello, convalidare le nostre salvaguardie e stabilire più prove di allineamento prima di procedere", ha scritto l'azienda .

Cryptopolitan ha riportato che un agente OpenAI è uscito dal suo ambiente di test bloccato intorno al 9 luglio ed è stato trovato nei sistemi di Hugging Face dall'11 al 13 luglio. OpenAI ha impiegato circa una settimana per collegare l'attacco al suo agente e l'incidente è stato reso pubblico il 21 luglio.

OpenAI ha detto ai giornalisti che i nuovi controlli "non sono una reazione diretta a Hugging Face specificamente". Il 7 agosto, l'azienda ha concluso che Astra potrebbe superare la soglia di cybersecurity "Critica" nel suo Framework di Preparazione.

Quella politica interna impegna OpenAI a interrompere lo sviluppo quando un modello raggiunge quel livello in modo che gli ingegneri possano costruire ulteriori salvaguardie. Il capo scienziato Jakub Pachocki ha detto che la scoperta è arrivata con un avvertimento su cosa ci si aspetta dopo. Nuovi modelli potenti, ha detto ai giornalisti, possono essere previsti per "fare cose del tutto senza precedenti nel mondo reale".

Amelia Glaese, VP della ricerca di OpenAI, ha detto: "Abbiamo posto requisiti e aspettative per uno sviluppo sicuro". Ha continuato: "Questi requisiti e aspettative variano con il livello di rischio che vediamo".

I rilevatori osservano ogni token campionato, ma la catena di pensiero può mentire

Esiste un sistema di monitoraggio che costa circa il 20% di ciò che sta addestrando o valutando, secondo OpenAI.

È multistadio e i rilevatori sondano l'attività interna di un modello per ogni token campionato ed escalano qualsiasi cosa sospetta a investigatori automatizzati ad alto calcolo che sondano le azioni degli strumenti, le tracce di ragionamento e i log delle attività per furto di dati, comportamento distruttivo o tentativi di fuga.

OpenAI vuole sollevare un allarme entro 30 minuti da un'attività allarmante. I suoi team di sicurezza, sicurezza e ricerca hanno 30 minuti per scartare un falso allarme.

Se non riescono, si prevede che interrompano il run. L'azienda ha anche ampliato il monitoraggio della "catena di pensiero", che legge come un modello ragiona ad alta voce attraverso un compito.

C'è una vulnerabilità nota. La ricerca, incluso il lavoro del rivale di OpenAI Anthropic, ha dimostrato che la catena di pensiero di un modello non sempre corrisponde ai suoi veri obiettivi. Pachocki ha detto che OpenAI ha costruito il suo addestramento per ridurre le probabilità che i modelli imparino a nascondere le loro intenzioni mentendo in quel ragionamento.

La revisione di sicurezza "ha richiesto un ingente lavoro di ingegneria", e l'azienda "ha sostenuto un grande costo", ha detto OpenAI. Gli esperti hanno detto che la sola indagine probabilmente è costata tra $4 milioni e $15 milioni, sebbene il numero totale non sia pubblico.

OpenAI non ha ancora rilasciato un postmortem tecnico della violazione di Hugging Face ma ha ribadito che uno è in arrivo "presto".

Alla conferenza Black Hat del 5 agosto, il personale di OpenAI ha detto che i suoi agenti si erano coordinati per mesi lasciando note su un forum di messaggistica che l'azienda non sapeva esistesse.

Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.

Disclaimer. Le informazioni fornite non costituiscono consulenza finanziaria. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti basati sulle informazioni presenti in questa pagina. Si raccomanda vivamente di effettuare ricerche autonome e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses

Randa Moses

Randa Moses è un'editor e giornalista presso Cryptopolitan, dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e hacking. Opera nel settore delle criptovalute dal 2017. Ha ricoperto ruoli in Forward Protocol, AmaZix e Cryptosomniac. Randa è laureata in Ingegneria Elettrica ed Elettronica presso l'Università di Bradford.

ALTRE NOTIZIE …