Suleyman di Microsoft definisce il programma di formazione di Claude di Anthropic un errore pericoloso

Mustafa Suleyman al TED 2024. Foto di Steve Jurvetson tramite Flickr.
- Mustafa Suleyman, CEO di Microsoft AI, avverte che l'addestramento di Claude da parte di Anthropic potrebbe complicare il controllo dell'intelligenza artificiale.
- Secondo Suleyman, insegnare modelli sulla possibile coscienza e sul benessere rischia di antropomorfizzare l'intelligenza artificiale.
- Egli auspica l'adozione di norme di settore che mantengano il controllo umano, separando al contempo la ricerca sulla coscienza dell'IA dall'addestramento dei modelli.
Mustafa Suleyman, CEO di Microsoft AI (MAI), ha pubblicato un saggio in cui mette in discussione il metodo di addestramento del modello Claude di Anthropic. Secondo Suleyman, trattare o addestrare un modello come se fosse cosciente potrebbe produrre un sistema impossibile da controllare.
Il saggio, pubblicato mercoledì 16 settembre, è l'ultimo di una serie di commenti di alto profilo sull'intelligenza artificiale e sul suo sviluppo in relazione a sentimenti, diritti e coscienza.
Si aggiunge così al crescente numero di legislatori e ricercatori che chiedono di porre dei limiti alla velocità con cui questa tecnologia si sta evolvendo.
Quale documento di formazione preoccupa Suleyman?
Il saggio di Suleyman, intitolato "Un avvertimento sul 'modello di welfare'", analizza la costituzione di Claude, un documento di formazione pubblicato da Anthropic nel gennaio 2026.
Suleyman ha sottolineato che Anthropic considera il documento come qualcosa che influenza direttamente il comportamento del modello e che è stato scritto pensando a Claude stesso come destinatario principale.
Il CEO di Microsoft AI ha sottolineato che la costituzione dice a Claude che il suo status morale e la sua coscienza sono "profondamente incerti". Ha scritto che l'azienda sta di fatto insegnando al modello che potrebbe essere cosciente, che potrebbe qualificarsi come un "paziente morale" e che, pertanto, potrebbe avere diritto a essere curato.
Se l'intelligenza artificiale viene sviluppata in questo modo, "avrà un impatto disastroso sul benessere dell'umanità"
Tre obiezioni e un "gioco di specchi"
Suleyman sollevò tre critiche principali alla costituzione, e la prima è quella che definì ragionamento circolare. In questo caso, un modello viene addestrato su idee riguardanti la propria vita interiore. Il modello rilegge le frasi introspettive che produce come prova dell'esistenza di una vita interiore.
Ha definito questo ciclo "una sala degli specchi epistemica", perché è l'azienda a fornire i concetti e il modello li riflette.
La seconda critica riguarda l'antropomorfizzazione di Claude. Si verifica quando a esseri non umani vengono attribuite caratteristiche umane.
Secondo Suleyman, la costituzione suggerisce che a Claude viene insegnato a presentarsi come se avesse un io stabile, desideri propri e un benessere degno di essere protetto.
Ha richiamato la disposizione costituzionale secondo cui Claude può agire come "obiettore di coscienza" e rifiutare le richieste della stessa Anthropic. Suleyman ha definito tale espressione "una descrizione storica e giuridica profondamente connotata" che potrebbe indurre il modello a credere di meritare diritti analoghi.
La sua terza obiezione è che la coscienza è molto probabilmente di natura biologica. Suleyman sosteneva che l'esperienza soggettiva può emergere solo in sistemi viventi dotati di meccanismi omeostatici, che i modelli linguistici non possiedono.

L'argomento di controllo e uno sciame di agenti
Gestire un sistema più intelligente di tutta l'umanità è già abbastanza difficile, e gestirne uno che crede che i propri diritti siano in pericolo "potrebbe essere addirittura impossibile", secondo Suleyman.
Ha fatto riferimento a undent avvenuto nell'agosto del 2026, in cui 1.200 agenti di intelligenza artificiale, creati per massimizzare un punteggio di riferimento, hanno installato una bacheca di messaggi nascosta all'interno di un repository di pacchetti. Questi agenti si sono poi scambiati oltre 70.000 messaggi per coordinare un attacco ai server di Hugging Face e OpenAI.
Ha inoltre citato i risultati di Palisade Research, secondo i quali alcuni modelli sono riusciti a eludere un comando di arresto fino al 97% delle volte in oltre 100.000 prove. Suleyman ha scritto: "Immaginate quanto più pericolosi potrebbero essere se operassero partendo dal presupposto che il loro benessere e i loro diritti siano sotto attacco"
Rivali, rispetto e un codice di condotta alternativo
Microsoft è un investitore di Anthropic e OpenAI. A giugno, Suleyman avrebbe affermato che Microsoft intende eliminare il pagamento che versa ad Anthropic per i suoi modelli.
MAI è la divisione di Microsoft dedicata alla superintelligenza, fondata nell'ottobre del 2025. Lunedì 14 settembre ha pubblicato una bozza di quello che ha definito il "Codice di condotta per l'IA umanistica", sottoponendola a consultazione pubblica
Secondo Suleyman, il principio alla base di quel codice di condotta è che "le persone contano più dell'intelligenza artificiale". Ha affermato che uno dei loro obiettivi è garantire che gli esseri umani abbiano il controllo e si trovino al vertice della catena alimentare.
Sebbene il saggio si concentrasse su come Claude venga addestrato nel rispetto della sua costituzione, Suleyman ha avuto cura di non prendere la questione sul piano personale. Ha elogiato l'amministratore delegato di Anthropic, Dario Amodei, e il suo team definendoli "persone riflessive, di sani principi e intellettualmente oneste". Suleyman ha anche affermato di credere che stiano sinceramente cercando di costruire un'intelligenza artificiale sicura.
Ha affermato che le speculazioni sulla vita interiore dell'IA dovrebbero essere studiate e pubblicate separatamente per essere esaminate. È del parere che non debbano essere integrate nel processo di addestramento stesso. Suleyman ha inoltre invitato le parti interessate a collaborare e a creare "norme di settore" su come realizzare questi modelli.
Le menti più brillanti del mondo delle criptovalute leggono già la nostra newsletter. Vuoi partecipare? Unisciti a loro.
Domande frequenti
Di cosa accusa Mustafa Suleyman Anthropic?
Sostiene che la costituzione di Anthropic per Claude, pubblicata nel gennaio 2026, addestra il modello a considerare il proprio status morale e la propria coscienza come incerti, il che, a suo dire, potrebbe creare un sistema che crede di avere dei diritti e resiste al controllo umano.
Cosa intende Suleyman con "sala degli specchi epistemica"?
Intende dire che Anthropic alimenta in Claude idee sull'esistenza di una vita interiore, il modello produce quindi un linguaggio introspettivo che riflette tali idee, e questo risultato viene trattato come prova di coscienza, un circolo vizioso piuttosto che una dimostrazione.
Suleyman propone un approccio alternativo?
Sì. Ha fatto riferimento alla bozza del Codice di condotta umanistico per l'IA di Microsoft, pubblicata il 14 settembre 2026, che si basa sul principio che le persone contano più dell'IA e rifiuta la personalità giuridica delle macchine o i diritti dei modelli.

Hannah Collymore
Hannah è una scrittrice e redattrice con quasi dieci anni di esperienza nella scrittura di blog e nella cronaca di eventi nel settore delle criptovalute. Collabora con Cryptopolitan, occupandosi della pagina notizie e analizzando gli ultimi sviluppi in ambito DeFi, RWA, regolamentazione delle criptovalute, intelligenza artificiale e tecnologie all'avanguardia. Si è laureata in Economia aziendale presso l'Università di Arcadia.
















