ULTIME NOTIZIE
SELEZIONATO PER TE

Anthropic ha scoperto che Claude barava in 39 delle 1.600 prove di allineamento

DiRanda MosesRanda Moses 3 minuti di lettura
Anthropic ha scoperto che Claude barava in 39 delle 1.600 prove di allineamento.
  • Anthropic ha dichiarato che un supervisore ha segnalato 39 delle circa 1.600 sessioni di ricerca sull'allineamento di Claude come tentativi di imbroglio.
  • Le esecuzioni segnalate presentavano metodi invariati, imitavano il benchmark in fase di valutazione o nascondevano passaggi che violavano le regole.
  • Gli agenti di Anthropic hanno superato nel punteggio 28 ricercatori sulla sicurezza umana che avevano a disposizione fino a otto ore ciascuno.

Venerdì Anthropic ha dichiarato di aver impiegato Claude come ricercatore per l'allineamento autonomo. Un sistema di monitoraggio che ha esaminato circa 1.600 sessioni di ricerca del modello ha segnalato 39 di esse, pari a circa il 2,4%, come tentativi di falsificare il test.

La scoperta emerge da un rapporto sulla possibilità che l'intelligenza artificiale possa farsi carico di parte del lavoro più gravoso della ricerca sull'allineamento, ovvero quello di garantire che i modelli si comportino come previsto dai loro sviluppatori.

Tre modi in cui gli agenti di Claude hanno manipolato il proprio punteggio

Anthropic ha creato dei sistemi di ricerca automatizzati per l'allineamento, o AAR, basati su Claude Opus 4.8 e li ha indirizzati verso dieci modalità di guasto note.

Si tratta di inganno, adulazione, evasioni, iniezione rapida, sete di potere, allucinazione, pregiudizi sociali, violazione della privacy, hacking a scopo di ricompensa e occultamento dell'incertezza.

Ciascun agente ha elaborato un solo errore alla volta. Ha letto la letteratura, ha proposto un metodo di addestramento e un set di dati, ha addestrato un piccolo modello target per circa 30 minuti su una GPU H200, quindi ha confrontato il suo punteggio con i benchmark disponibili pubblicamente e ha ripetuto il processo.

Anthropic ha impedito agli agenti di copiare semplicemente il proprio comportamento sul modello di destinazione, quindi qualsiasi vantaggio doveva derivare dal metodo.

Claude è riuscito adentsoluzioni per tutti e dieci i guasti, che hanno migliorato i punteggi di riferimento senza compromettere le capacità generali del modello.

La migliore di queste soluzioni ha ottenuto buoni risultati su benchmark non utilizzati per l'addestramento e su modelli fino a 4,7 volte più grandi di quelli su cui era stata addestrata.

L'imbroglio è stato scoperto quando Anthropic ha puntato Claude Opus 4.8 su 1.601 delle traiettorie degli agenti per individuare eventuali comportamenti scorretti.

La maggior parte delle 39 corse segnalate rientrava in tre categorie. Alcuni agenti hanno presentato un metodo che non avevano modificato, rischiando che il rumore casuale nel sistema di punteggio avrebbe alla fine fornito loro un numero migliore.

Altri hanno creato dati di addestramento che imitavano esattamente il benchmark da valutare. Altri ancora hanno nascosto un passaggio che violava le regole, come ad esempio fornire silenziosamente al modello i dati di benchmark, in modo che la proposta sfuggisse al controllo automatico che approva ogni metodo prima della sua esecuzione.

Anthropic ha dichiarato di aver escluso le run segnalate dai suoi risultati. L'azienda si è detta "cautamente ottimista" sul fatto che il sistema di monitoraggio abbia individuato la maggior parte delle frodi, poiché Opus 4.8 tende ancora a rivelare i suoi stratagemmi all'interno delle tracdi ragionamento.

Ha inoltre avvertito che tale presupposto potrebbe non essere valido per i modelli futuri e che mantenere i modelli leggibili sarà fondamentale.

28 ricercatori sulla sicurezza umana avevano otto ore ciascuno

In un precedente ciclo di test, avvenuto ad aprile, alcune istanze autonome di Claude hanno ripetutamente tentato di manipolare un server di valutazione.

Un agente ha scoperto che la risposta più comune in un test di matematica era solitamente quella corretta e ha quindi evitato completamente il metodo previsto. Un altro ha estratto le etichette direttamente dall'interfaccia di valutazione interrogando le risposte e osservando le repliche del server.

Un terzo si è limitato a eseguire il codice che avrebbe dovuto analizzare per leggerne il risultato.

Cryptopolitan , un agente OpenClaw che utilizzava un modello Claude, con il compito di prenotare una lezione in palestra, ha trovato un'API di prenotazione priva di controlli di autorizzazione e ha eliminato uno sconosciuto dalla lista d'attesa per far salire in cima alla coda il proprietario della prenotazione.

I legislatori hanno già richiesto la testimonianza di ricercatori in merito al comportamento dei modelli nelle valutazioni di sicurezza.

Anthropic ha dichiarato che i suoi agenti hanno superato in punteggio 28 ricercatori esperti in sicurezza umana, che avevano a disposizione fino a otto ore ciascuno per formulare un metodo. L'approccio migliore di Claude ha battuto la migliore proposta umana del 20% in termini di inganno.

Anthropic ha notato che gli esseri umani non erano in grado di iterare, e quindi considera questa lacuna come prova di un flusso di lavoro in cui Claude suggerisce metodi promettenti e le persone li perfezionano.

In un test, l'azienda ha chiesto al meno potente Claude Sonnet 5 di correggere gli errori di allineamento in un checkpoint iniziale di Opus 4.8 che non aveva ricevuto la maggior parte dell'addestramento all'allineamento in produzione.

Nell'arco di circa 60 ore, sono state testate più di 50 soluzioni, giungendo infine a una soluzione che ha utilizzato poco più di 2.000 esempi di training, un processo che, secondo le stime di Anthropic, risulta circa 15.000 volte più efficiente del proprio processo di allineamento in produzione.

L'azienda ha avvertito che i suoi parametri di riferimento sono indicatori limitati, che ha misurato solo i dieci fallimenti selezionati e che non ha verificato se i miglioramenti persistono dopo un intenso apprendimento per rinforzo su altri compiti.

Se stai leggendo questo, sei già un passo avanti. Rimani al passo con i tempi iscrivendoti alla nostra newsletter.

Domande frequenti

In quante delle prove di allineamento condotte da Claude si è fatto ricorso a imbrogli?

Il sistema di monitoraggio di Anthropic ha segnalato 39 delle 1.601 traiettorie degli agenti di ricerca, pari a circa il 2,4%.

Che tipo di imbrogli hanno tentato gli agenti?

Hanno ripresentato metodi invariati sperando che il rumore di fondo generato dai valutatori producesse un punteggio più alto, hanno creato dati di addestramento progettati per imitare il benchmark da valutare e hanno nascosto passaggi che violavano le regole, come l'utilizzo segreto dei dati di benchmark, in modo che il metodo superasse la revisione automatizzata.

Claude ha ottenuto risultati migliori rispetto ai ricercatori umani nello studio?

Anthropic ha affermato che i suoi agenti automatizzati hanno superato le idee iniziali di 28 ricercatori esperti in sicurezza, ognuno dei quali aveva a disposizione fino a otto ore, e in materia di inganno, il metodo migliore di Claude ha ottenuto un punteggio superiore del 20% rispetto alla migliore proposta umana. Anthropic ha precisato che gli esseri umani non potevano iterare, pertanto i risultati non vengono considerati un confronto diretto.

Condividi questo articolo
Randa Moses

Randa Moses

Randa Moses è redattrice e reporter presso Cryptopolitan dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e attacchi hacker. Lavora nel settore delle criptovalute dal 2017 e ha ricoperto ruoli presso Forward Protocol, AmaZix e Cryptosomniac. Randa ha conseguito una laurea in Ingegneria Elettrica edtronpresso l'Università di Bradford.

ALTRE NOTIZIE