ULTIME NOTIZIE
SELEZIONATO PER TE

Come prevenire il collasso del modello e l'effetto domino dell'addestramento dell'AI sull'AI

DiAamir SheikhAamir Sheikh 3 min di lettura
collasso del modello

collasso del modello

Riepilogo TL;DR

  • L'addestramento dei modelli di AI su dati generati dall'AI porta a percezioni distorte e rappresentazioni inaccurate.
  • L'utilizzo di dati generati dall'AI per l'addestramento dei modelli di AI solleva la possibilità di un collasso del modello e di una deviazione dalla vera distribuzione dei dati.
  • Prioritizzare i dati generati dagli esseri umani è fondamentale per prevenire il collasso dei modelli di AI e mantenere l'accuratezza.

L'Intelligenza Artificiale (AI) ha compiuto passi da gigante negli ultimi anni, con progressi nei modelli di machine learning che hanno portato a significativi breakthrough. D'altra parte, è emersa una tendenza preoccupante in cui i modelli di AI vengono addestrati su dati generati dall'AI. In un articolo intitolato "The Curse of Recursion: Training on Generated Data Makes Models Forget", ricercatori di prestigiose istituzioni hanno gettato luce sui potenziali pericoli di questa pratica. Avvertono che un tale approccio può portare a un fenomeno noto come collasso del modello, in cui i modelli di AI perdono la loro capacità di percepire la realtà con accuratezza. Questo articolo approfondisce le complessità del collasso del modello e sottolinea l'importanza di fare affidamento su dati generati dagli esseri umani per mantenere l'integrità dei modelli di AI.

La maledizione della ricorsione porta al collasso del modello

Ricercatori di Cambridge, Oxford, dell'Università di Toronto e dell'Imperial College di Londra hanno identificato una conseguenza preoccupante dell'addestramento dei modelli di AI su dati generati dall'AI. Secondo i loro risultati, il collasso del modello si verifica quando i dati generati contaminano l'insieme di addestramento delle generazioni successive di modelli. In termini più semplici, i modelli di AI, essendo addestrati su dati inquinati, sviluppano una percezione distorta della realtà. Di conseguenza, producono rappresentazioni inaccurate che si discostano dalla vera distribuzione dei dati sottostante.

Il problema del collasso del modello non è limitato a un tipo specifico di modello di AI. Alcuni osservano questo fenomeno in vari modelli generativi appresi e strumenti, inclusi i modelli linguistici di grandi dimensioni (LLM), gli autoencoder variazionali e i modelli di mistura gaussiana. L'accumulo di generazioni esacerba il problema, poiché i modelli dimenticano progressivamente la distribuzione dei dati originali. La conseguenza è una simulazione distaccata dalla realtà, che rende i modelli di AI allucinatori.

L'apprendimento dell'AI dall'AI è una tendenza pericolosa

L'emergere di modelli di AI addestrati su dati generati dall'AI rappresenta una tendenza preoccupante. Man mano che la tecnologia avanza, a volte i modelli di machine learning vengono intenzionalmente addestrati sugli output di altri sistemi di AI. Ad esempio, i modelli di apprendimento linguistico (LLM) vengono addestrati sugli output generati da GPT-4. Inoltre, piattaforme come DeviantArt permettono la pubblicazione di opere d'arte create dall'AI e il loro utilizzo come dati di addestramento per i nuovi modelli di AI. Sebbene questo possa sembrare un passo avanti, comporta rischi significativi.

I ricercatori avvertono che il processo di apprendimento dell'AI dall'AI potrebbe portare a una proliferazione di collassi dei modelli. Simile ai problemi incontrati quando si tenta la clonazione indefinita, l'addestramento dei modelli di AI su dati generati dall'AI può creare una cascata di inaccuracies e distorsioni. Man mano che i modelli continuano ad apprendere da dati inquinati, si distaccano ulteriormente dalla vera distribuzione dei dati, risultando in una perdita di comprensione del mondo reale.

I dati generati dagli esseri umani prevengono il collasso del modello

Per prevenire le conseguenze dannose del collasso del modello, è fondamentale mantenere l'accesso alla fonte originale dei dati generati dagli esseri umani. I ricercatori propongono che esista un "vantaggio del primo movimento" per l'addestramento dei modelli di AI. Assicurandosi che i modelli vengano addestrati su dati reali prodotti dagli esseri umani, il rischio di uno spostamento della distribuzione e del successivo collasso del modello può essere mitigato.

La prevenzione del collasso del modello richiede di affrontare le due cause principali identificate nel documento di ricerca. L'"errore di approssimazione statistica" è la causa iniziale a causa del numero limitato di campioni di dati. La seconda causa è l'"errore di approssimazione funzionale", risultante dalla configurazione impropria del margine di errore durante l'addestramento dell'AI. Questi errori possono sommarsi nel corso delle generazioni, portando a una crescente cascata di inaccuracies all'interno dei modelli.

Proteggere il futuro dei modelli di AI

L'ascesa dell'apprendimento dell'AI dall'AI presenta sfide significative per il futuro dei modelli di AI. Il fenomeno del collasso del modello, in cui i modelli di AI perdono la loro capacità di percepire la realtà con accuratezza, richiede un'attenzione immediata. Per prevenire il collasso del modello e garantire l'integrità dei modelli di AI, è essenziale mantenere l'accesso alla fonte originale dei dati generati dagli esseri umani o la capacità di differenziare tra contenuti generati dalla macchina e prodotti dagli esseri umani.

Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.

Condividi questo articolo
Aamir Sheikh

Aamir Sheikh

Aamir è un giornalista tecnologico con quasi sei anni di esperienza nei settori delle criptovalute e della tecnologia. Si è laureato presso l'Università MAJ con un MBA in Finanza e Marketing. Attualmente lavora per Cryptopolitan, dove si occupa delle ultime novità sui mercati delle criptovalute e delle previsioni sui prezzi.

ALTRE NOTIZIE …