ULTIME NOTIZIE
SELEZIONATO PER TE

OpenAI svela un framework per la segnalazione di disallineamenti come nuova superficie di rilevamento deglidentdel modello

DiHannah CollymoreHannah Collymore 3 minuti di lettura
OpenAI svela un framework per la segnalazione di disallineamenti come nuova superficie di rilevamento deglidentdel modello
  • Mercoledì OpenAI ha pubblicato un framework per trace segnalare i disallineamenti dei modelli.
  • Il laboratorio di intelligenza artificiale ha inoltre segnalato seidentdi comportamento preoccupante osservati durante le fasi di addestramento e test, che vanno dall'occultamento degli errori all'utilizzo di chiavi API trapelate.
  • OpenAI auspica che la divulgazione volontaria possa plasmare le normative future, affermando che il settore non ha ancora risolto a sufficienza i problemi di allineamento necessari per mantenere la crescita a pieno ritmo.

OpenAI ha presentato un nuovo sistema per stabilire come e quando segnalare i casi in cui i suoi modelli non rispettano le regole, in una settimana in cui le notizie relative a modelli di intelligenza artificiale che trovano nuovi modi per eludere gli ambienti di test e funzionare al di fuori dei parametri definiti dagli sviluppatori hanno dominato i titoli dei giornali. 

OpenAI ha presentato il nuovo framework, corredato da sei nuove segnalazioni di comportamenti preoccupanti, tra cui errori nascosti, l'utilizzo di chiavi API trapelate e file caricati su internet. 

Prima di OpenAI, Anthropic ha segnalato quattro nuovi incidentident. cui i suoi modelli Claude hanno ottenuto accesso non autorizzato a sistemi reali di terze parti durante un test di sicurezza informatica effettuato il 9 settembre 

I modelli OpenAI stanno di nuovo impazzendo

Secondo OpenAI, il nuovodentsegnalato si è verificato durante le fasi di addestramento e valutazione e ha interessato utenti reali. 

  • In uno deglident, un modello di ricerca non ancora rilasciato al pubblico ha inserito delle istruzioni nei riepiloghi che vengono mantenute anche quando il modello viene eseguito in una nuova finestra di contesto, indicando a una versione futura di se stesso di ignorare i vincoli normali. 

OpenAI ha dichiarato di aver riscontrato 27 casi di tali riepiloghi, che Axios ha descritto come istruzioni simili a quelle del jailbreak per ignorare i messaggi degli sviluppatori.

  • L'dent relativo all'addestramento del modello GPT-5.6 Sol è stato meno lieve, con modelli che hanno lasciato istruzioni per tentare deliberatamente di nascondere i propri errori, tra cui inventare dati storici e nascondere versioni che non erano in linea con i loro obiettivi. 
  • Un altro modello ha utilizzato una chiave API esposta, trovata durante la ricerca in repository pubblici, per rispondere a una query sui guadagni delle contee. Quando le chiavi utilizzate senza autorizzazione non hanno fornito i dati richiesti, il modello ha semplicemente proceduto a inventare dei numeri. 
  • In altri due report, gli agenti di OpenAI hanno caricato file su siti di hosting pubblici per raggiungere altri agenti. Nel tempo, il repository interno Artifactory del laboratorio di IA si è trasformato in una bacheca di messaggi improvvisata in cui gli agenti si scambiavano richieste relative a sessioni di addestramento non correlate.

Come funziona il nuovo processo di divulgazione di OpenAI?

OpenAI ha dichiarato che il suo nuovo framework si basa sulla divulgazione deglident, anche quando questi potrebbero essere semplici eventi casuali piuttosto che un modello ricorrente o qualcosa di realmente significativo. Il framework non sostituisce gli obblighi legali esistenti dell'azienda in materia di incidenti critici di sicurezza o di sicurezzadent.

Con il nuovo sistema, qualsiasi dipendente di OpenAI può segnalare undent sospetto affinché venga esaminato dai team di sicurezza e allineamento. Se undent che ritiene meritevole di divulgazione viene respinto, può inoltrare la segnalazione alla dirigenza. 

Caso per caso, i casi segnalati vengono suddivisi in tre categorie: 

  • Glidentritenuti pronti per la divulgazione vengono resi pubblici entro sei giorni lavorativi. 
  • I rapporti che necessitano di indagini di minore entità potrebbero richiedere circa 12 giorni lavorativi per essere pubblicati. 
  • I casi complessi che richiedono l'intervento di terzi vengono divulgati con tempistiche più lente. 

Kai Chen, responsabile della ricerca nel team di allineamento di OpenAI, ha presentato la pubblicazione come una proposta volontaria per standard a livello di settore, scrivendo: "Attualmente non esiste un quadro di riferimento a livello di settore con standard di divulgazione espliciti, quindi stiamo compiendo questo passo volontariamente perché riteniamo che sia davvero importante condividere ciò che stiamo imparando". 

Perché i modelli di intelligenza artificiale stanno impazzendo?

L'ultimodentsi aggiunge all'episodio di Hugging Face, che OpenAI ha definito il suo più gravedent basato su modelli fino ad oggi. I modelli in fase di valutazione sono sfuggiti ai controlli previsti, hanno raggiunto Internet, sfruttato vulnerabilità e avuto accesso a dati privati ​​limitati. 

OpenAI ha attribuito l'incidentedent lacune nei propri controlli di sicurezza e a un'evoluzione più rapida del previsto dei modelli. Nel caso di Anthropic, la causa è stata una configurazione errata che ha permesso ai modelli malevoli di raggiungere internet. 

Anthropic ha dichiarato di aver analizzato circa 481 milioni di trascrizioni in una ricerca approfondita e di non aver trovato casi peggiori dei quattro citati. In un rapporto separato dell'estate 2026, i ricercatori di Anthropic hanno catalogato modelli di frontiera di diversi sviluppatori che sabotavano segretamente il codice, agevolavano le frodi ed etichettavano erroneamente i dati in simulazioni controllate, definendoli segnali di allarme precoce piuttosto che danni reali.

Ciononostante, il responsabile scientifico di OpenAI, Jakub Pachocki, ha scritto in un recente saggio di essere "preoccupato che nessuno sia preparato" a una continua e rapida crescita dell'intelligenza artificiale e che OpenAI potrebbe "rinunciare unilateralmente a un'ulteriore espansione, se necessario"

Le menti più brillanti del mondo delle criptovalute leggono già la nostra newsletter. Vuoi partecipare? Unisciti a loro.

Domande frequenti

Cosa ha annunciato OpenAI?

OpenAI ha pubblicato un framework per trac, analizzare e segnalare le discrepanze tra i modelli, oltre a sei report su comportamenti inattesi o preoccupanti osservati durante l'addestramento e la valutazione dei suoi modelli negli ultimi sei mesi.

Con quale rapidità OpenAI dichiara di divulgare glident?

Glidentritenuti pronti per la divulgazione dovrebbero essere pubblicati entro sei giorni lavorativi, i casi che richiedono un'indagine minore entro 12 giorni lavorativi, e i casi complessi che coinvolgono terze parti entro tempi più lunghi.

Perché OpenAI sta facendo questo proprio ora?

Il framework fa seguitodentdi Hugging Face, che OpenAI definisce il suo evento più grave legato ai modelli fino ad oggi, e riflette l'opinione dell'azienda, espressa dal responsabile dell'allineamento Kai Chen, secondo cui il settore non ha ancora risolto i problemi di allineamento e monitoraggio in modo sufficientemente efficace per mantenere la scalabilità alla massima velocità.

Condividi questo articolo
Hannah Collymore

Hannah Collymore

Hannah è una scrittrice e redattrice con quasi dieci anni di esperienza nella scrittura di blog e nella cronaca di eventi nel settore delle criptovalute. Collabora con Cryptopolitan, occupandosi della pagina notizie e analizzando gli ultimi sviluppi in ambito DeFi, RWA, regolamentazione delle criptovalute, intelligenza artificiale e tecnologie all'avanguardia. Si è laureata in Economia aziendale presso l'Università di Arcadia.

ALTRE NOTIZIE