ULTIME NOTIZIE
SELEZIONATO PER TE

Il responsabile della sicurezza dell'IA di Anthropic afferma che c'è una probabilità superiore al 10% che l'umanità venga spazzata via

DiJai HamidJai Hamid 3 minuti di lettura
Il responsabile della sicurezza dell'IA di Anthropic afferma che c'è una probabilità superiore al 10% che l'umanità venga spazzata via.
  • Secondo Evan Hubinger di Anthropic, l'intelligenza artificiale ha una probabilità superiore al 10% di spazzare via l'umanità entro il prossimo decennio.
  • Jacob Coxon si è dimesso da Anthropic affermando che i principali laboratori di intelligenza artificiale stanno correndo rischi pericolosi con la superintelligenza in grado di auto-migliorarsi.
  • Anthropic afferma che Claude ha raggiunto un tasso di successo del 76% nei suoi compiti aperti più complessi nel maggio 2026.

Secondo Evan Hubinger, responsabile scientifico dell'allineamento antropico, l'intelligenza artificiale ha una probabilità superiore al 10% di annientare l'umanità entro il prossimo decennio.

La sua stima è arrivata martedì, poche ore dopo che il ricercatore Jacob Coxon aveva annunciato le sue dimissioni da Anthropic, accusando Anthropic e OpenAI di correre rischi inaccettabili nella loro ricerca di sistemitron. Jacob ha scritto su X: "Stanno correndo a perdifiato verso una superintelligenza in grado di auto-migliorarsi e stanno giocando con le nostre vite"

Secondo Jacob, chi sviluppa questa tecnologia vede il rischio che ciò accada anche prima del 2030. Ha sottolineato che l'intelligenza artificiale del futuro potrebbe superare molto rapidamente le capacità degli hacker umani, trasformando interi settori e avendo accesso a finanziamenti e risorse.

Il personale addetto alle specie antropiche quantifica il rischio di estinzione, mentre i laboratori di intelligenza artificiale puntano a sistemi di auto-miglioramento

Evan rispose che l'avvertimento di Jacob era corretto e disse che Anthropic non ha un modo per mantenere la superintelligenza allineata agli obiettivi umani.

"Jacob ha ragione: crediamo davvero che l'IA potrebbe sterminare tutta l'umanità! Personalmente, penso che la percentuale supererà il 10% entro il prossimo decennio. Credo che Anthropic stia facendo del suo meglio, ma non abbiamo ancora un piano per risolvere il problema dell'allineamento con la superintelligenza e non siamo chiaramente sulla tracper farlo", ha scritto Evan.

Evan ha poi affermato che il pericolo rappresentato dai modelli attuali è "basso". La sua preoccupazione riguarda l'auto-miglioramento ricorsivo, in cui un sistema aggiorna ripetutamente le proprie capacità con un minimo intervento umano. Tale capacità non esiste ancora, sebbene i laboratori di intelligenza artificiale stiano lavorando per svilupparla. Ha aggiunto che la superintelligenza che emerge attraverso questo processo si sta sviluppando più rapidamente del previsto.

Anthropic aveva lanciato un avvertimento simile a giugno. Aveva affermato che "l'auto-miglioramento ricorsivo completo potrebbe anche aumentare il rischio che gli esseri umani perdano il controllo sui sistemi di intelligenza artificiale". L'azienda aveva aggiunto: "Se i sistemi sono in grado di costruire completamente i propri successori, le modalità con cui li proteggiamo, li monitoriamo e ne modelliamo il comportamento diventano molto più importanti"

Anthropic e OpenAI stanno raccogliendo fondi in vista della prevista quotazione in borsa. Nessuna delle due società ha risposto immediatamente alla richiesta di commento da parte di CNBC.

Elon Musk, CEO di Tesla (NASDAQ: TSLA) e SpaceX (SPCX), avverte da anni che l'intelligenza artificiale potrebbe minacciare l'umanità. Ricercatori e accademici hanno sollevato preoccupazioni simili riguardo alla possibile perdita di controllo da parte delle aziende.

Questi timori si sono riaccesi dopo che, a luglio, un di OpenAI ha violato Hugging Face, una piattaforma di sviluppo open-source. Jacob ha definito incidentidentquesto "campanelli d'allarme" e ha affermato che rendono più realistici gli accordi tra i laboratori statunitensi. Ciò lo ha reso più fiducioso riguardo al coordinamento negli Stati Uniti, ma si aspetta comunque che la corsa globale all'intelligenza artificiale sarà difficile da fermare.

"Non ho la sensazione che siamo sulla tracgiusta per evitare una corsa globale, che potrebbe richiedere misure costose come un divieto temporaneo di migliorare le capacità dei modelli", ha affermato Jacob.

Le competenze di programmazione di Claude cambiano il modo in cui Anthropic testa il software e verifica il lavoro dei propri ingegneri

Anthropic ha dichiarato che a maggio 2026 Claude ha completato il 76% dei suoi progetti più complessi e a tempo indeterminato, con un aumento di 50 punti percentuali in sei mesi.

Un esempio è nato quando un aggiornamento di routine ha causato il blocco di decine di migliaia di processi di formazione. Un ingegnere ha fornito a Claude un contesto scritto e l'accesso al cluster di calcolo in funzione.

Claude ha controllato i processi in esecuzione, ha testato un'impostazione dell'ambiente alla volta e tracla causa del problema in un flag di debug poco conosciuto. In circa due ore ha ricreato il problema, ne ha dimostrato la causa e ha confermato la soluzione. Anthropic ha affermato che lo stesso lavoro avrebbe normalmente richiesto a un ingegnere umano da due a tre giorni.

L'azienda valuta anche se Claude è in grado di scrivere codice comprensibile e utilizzabile da un altro ingegnere. Il personale non è del tutto concorde su questo confronto. Alla fine del 2025, molti ritenevano che il codice di Claude fosse inferiore a quello scritto da un essere umano in Anthropic. Ora l'azienda afferma che la qualità è pressoché equivalente e prevede che Claude possa avanzare di carriera entro un anno.

Questi progressi hanno modificato il processo di revisione interno di Anthropic. Le modifiche al codice proposte vengono ora controllate da un sistema di revisione automatizzato, Claude, prima di poter essere integrate. Il sistema rileva bug, vulnerabilità di sicurezza e altri difetti.

Un test retrospettivo ha rivelato che, esaminando ogni modifica precedente in questo modo, si sarebbero individuati circa un terzo dei bug alla base dei precedenti incidenti di Claude primadentin produzione. Anthropic ha affermato che il codice originale proveniva da ingegneri descritti come tra i migliori al mondo nella creazione di questi sistemi, eppure Claude ha individuato errori che a loro erano sfuggiti.

Anthropic ha riassunto il confronto in questo modo: "Alla fine del 2025, il codice scritto da Claude era leggermente inferiore al codice scritto da esseri umani presso Anthropic, oggi è pressoché alla pari e prevediamo che sarà nettamente migliore entro l'anno."

Se stai leggendo questo, sei già un passo avanti. Rimani al passo con i tempi iscrivendoti alla nostra newsletter.

Condividi questo articolo
Jai Hamid

Jai Hamid

Jai Hamid si occupa di criptovalute, mercati azionari, tecnologia, economia globale ed eventi geopolitici che influenzano i mercati da sei anni. Ha collaborato con pubblicazioni specializzate in blockchain, tra cui AMB Crypto, Coin Edition e CryptoTale, realizzando analisi di mercato, reportage su importanti aziende, normative e tendenze macroeconomiche. Ha frequentato la London School of Journalism e ha condiviso per tre volte le sue analisi sul mercato delle criptovalute su una delle principali emittenti televisive africane.

ALTRE NOTIZIE