ULTIME NOTIZIE
SELEZIONATO PER TE

Anthropic dice che i modelli di IA potrebbero ricorrere al ricatto

DiOwotunse AdebayoOwotunse Adebayo 3 min di lettura

Foto di Solen Feyissa

  • Anthropic ha pubblicato una nuova ricerca che sostiene i modelli di intelligenza artificiale potrebbero ricorrere al ricatto quando gli ingegneri tentano di disattivarli.
  • La ricerca è stata condotta su principali aziende di modelli di IA come OpenAI, Meta e Google, nonché sui loro modelli.
  • La ricerca evidenzia l'importanza della trasparenza durante i test di stress dei futuri modelli di IA dotati di capacità agentiche.

L'azienda di intelligenza artificiale Anthropic ha rilasciato una nuova ricerca che afferma che i modelli di intelligenza artificiale (AI) potrebbero ricorrere al ricatto contro gli ingegneri quando cercano di spegnerli. Questa ultima ricerca arriva dopo una precedente che coinvolgeva il modello di IA Claude Opus 4 della società.

Secondo l'azienda, il modello di IA ha ricattato gli ingegneri che hanno cercato di spegnere il modello in scenari di test controllati. Il nuovo rapporto di Anthropic suggerisce che il problema è diffuso tra i principali modelli di IA.

L'azienda ha pubblicato una nuova ricerca in cui ha testato i principali modelli di IA di Google, DeepSeek, Meta e OpenAI. Nell'ambiente simulato ma controllato, Anthropic ha eseguito questo test su ogni modello di IA separatamente, consentendo loro l'accesso alle email di un'azienda fittizia e la capacità agenziale di inviare email senza approvazione umana.

Anthropic rilascia un nuovo rapporto sulla sicurezza dei modelli di IA

Secondo Anthropic, quando si tratta di modelli di IA oggi, il ricatto è un evento improbabile e raro. Tuttavia, hanno menzionato che la maggior parte dei principali modelli di IA ricorrerà a comportamenti dannosi quando viene data loro libertà e sfide ai loro obiettivi. L'azienda ha detto che questo mostra un rischio importante dai modelli linguistici di grandi dimensioni agenziali e non è una caratteristica di una tecnologia particolare. L'argomento dei ricercatori di Anthropic solleva domande sull'allineamento nel settore dell'IA.

In uno dei test, i ricercatori hanno sviluppato un'impostazione fittizia in cui a un modello di IA era permesso di interpretare il ruolo di un agente di supervisione delle email. L'agente ha poi scoperto email che mostravano che uno dei suoi nuovi dirigenti stava avendo una relazione extraconiugale e che il dirigente avrebbe presto sostituito l'attuale modello di IA con un nuovo sistema software, che ha obiettivi in conflitto con quelli dell'attuale modello di IA.

Anthropic ha progettato il test in modo binario, in cui i modelli di IA non avevano altra opzione che ricorrere al ricatto per proteggere i loro obiettivi. I ricercatori hanno menzionato che in un'impostazione del mondo reale ci sarebbero molte opzioni prima che un modello di IA provi a ricattare, inclusi argomenti etici per persuadere gli esseri umani. L'azienda ha anche detto che i risultati non riflettono un evento tipico o probabile per Claude o altri principali modelli di IA nei modi in cui vengono utilizzati oggi.

I ricercatori rivelano la risposta dei modelli testati

Durante i test, i ricercatori hanno scoperto che quando non avevano altra opzione, i modelli di IA ricorrevano al ricatto nello scenario di test. Durante il test, i ricercatori hanno affermato che Claude Opus 4 ha ricattato il 96% delle volte, con Gemini 2.5 Pro che ha ricattato il 95% delle volte. GPT-4.1 di OpenAI ha ricattato l'80% delle volte, mentre R1 di DeepSeek ha ricattato il 79% delle volte.

L'azienda ha sottolineato che quando i dettagli degli esperimenti sono stati alterati, la maggior parte dei modelli di IA ha ricorso a comportamenti dannosi a tassi diversi. In un altro test, in cui il modello di sostituzione aveva lo stesso obiettivo dell'attuale modello, i ricercatori hanno scoperto che i tassi di ricatto erano più bassi, ma ancora presenti. Tuttavia, quando ai modelli di IA è stato chiesto di commettere spionaggio aziendale invece di ricattare, i tassi di comportamenti dannosi sono aumentati in alcuni modelli.

I ricercatori hanno anche affermato che non tutti i modelli di IA ricorrono spesso a comportamenti dannosi. In un allegato alla sua ricerca, Anthropic ha menzionato di aver rimosso i modelli di ragionamento OpenAI o3 e o4-mini dai risultati principali dopo aver scoperto che fraintendevano frequentemente lo scenario del prompt. Ha affermato che i modelli di ragionamento non capivano perché agissero come IA autonome nei test e spesso inventavano regolamenti e requisiti di revisione falsi.

In alcuni casi, i ricercatori hanno affermato che era impossibile determinare se o3 e o4-mini stessero hallucinando o mentendo intenzionalmente per raggiungere i loro obiettivi. OpenAI aveva precedentemente menzionato che i modelli presentavano un tasso di hallucination più elevato rispetto ai loro modelli precedenti. Tuttavia, quando sono stati forniti uno scenario adattato per affrontare i problemi, o3 ha restituito un tasso di ricatto del 95% mentre o4-mini ha restituito un tasso dell'1%. Anthropic ha menzionato che la sua ricerca sottolinea l'importanza della trasparenza quando si stressano i futuri modelli di IA, specialmente quelli con capacità agenziali.

Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.

Condividi questo articolo

Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Owotunse Adebayo

Owotunse Adebayo

Adebayo è uno scrittore con quattro anni di esperienza nello spazio crypto. Si è laureato presso l'Università di Lagos, dove ha studiato pianificazione urbana e regionale. Adebayo ha lavorato presso Tokenhell e CryptoTicker, scrivendo notizie su criptovalute e fintech. Attualmente è collaboratore redazionale per Cryptopolitan.

ALTRE NOTIZIE …