Decodificare il bias del dataset – Il Machine Learning rivela le fratture nelle scelte rischiose umane

- I ricercatori dell'Università Tecnica di Darmstadt rivelano un bias nei dataset delle scelte rischiose umane mediante l'uso del machine learning.
- Lo studio affronta le differenze tra le scelte online e quelle in laboratorio, introducendo un modello ibrido per contrastare l'aumento del rumore decisionale.
- Emergono le sfide legate all'affidamento su dataset online su larga scala, sollecitando un attento equilibrio tra teoria e analisi dei dati nella comprensione del processo decisionale umano.
Ricercatori della Technical University di Darmstadt e dell'Hessian Center for Artificial Intelligence, in Germania, si sono addentrati nella relazione intricata tra dataset e modelli per comprendere le scelte rischiose umane.
I loro risultati, pubblicati sulla rivista Nature Human Behaviour, mettono in luce la presenza del bias del dataset, illuminando le differenze sfumate nei comportamenti decisionali tra i partecipanti coinvolti in esperimenti online e in laboratorio. Utilizzando tecniche avanzate di machine learning, i ricercatori non solo identificano il bias, ma propongono anche un nuovo modello ibrido per colmare il divario creato dall'aumento del rumore decisionale nei dataset online.
L'interazione tra dataset decisionali e modelli ML
Comprendere l'interazione tra dataset decisionali e modelli di machine learning (ML) è cruciale per svelare le complessità del processo decisionale umano. La ricerca condotta dal team tedesco esamina sistematicamente questa relazione, utilizzando tre dataset distinti: Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) e Choices13k.
Questi dataset rappresentano uno spettro di scelte effettuate dai partecipanti sia in ambienti di laboratorio controllati che in esperimenti online su larga scala. Il team di ricerca ha impiegato vari modelli ML, inclusi metodi classici e architetture di reti neurali, addestrandoli su questi dataset per ottenere informazioni sulle variazioni di prestazioni e sui bias.
Approfondendo, lo studio ha scoperto che i modelli addestrati sul dataset Choices13k, indicativo di esperimenti online, mostravano una scarsa generalizzazione quando applicati a dataset di laboratorio più piccoli (CPC15 e CPC18). Allo stesso modo, i modelli addestrati su CPC15 non trasferivano perfettamente il loro potere predittivo al dataset Choices13k, rivelando un bias sistematico del dataset.
Questo bias indicava differenze notevoli nei comportamenti di scelta tra i partecipanti coinvolti in esperimenti di laboratorio e quelli partecipanti online. Questi risultati sottolineano l'importanza di riconoscere e affrontare il bias del dataset, specialmente quando si trattano contesti e fonti di dati diversificate.
Svelare il bias del dataset
La rivelazione del bias del dataset invita a un'ulteriore indagine sulle sue radici e implicazioni. Lo studio ha scoperto che i modelli addestrati sul dataset Choices13k mostravano una riluttanza a prevedere proporzioni estreme di scelta, indicando un modello decisionale distintivo nei partecipanti online rispetto ai loro controparti di laboratorio.
Per analizzare la fonte di questo bias, i ricercatori hanno analizzato meticolosamente le caratteristiche delle scommesse che erano predittive della differenza nel comportamento di scelta tra i dataset. Utilizzando tecniche come le regressioni lineari e le Spiegazioni Additive SHapley (SHAP), hanno quantificato l'importanza di ciascuna caratteristica. Sorprendentemente, le caratteristiche tratte dalla letteratura di psicologia ed economia comportamentale, come il dominio stocastico, la probabilità di vincita e la differenza nel valore atteso, hanno svolto un ruolo cruciale nell'influenzare il bias.
Queste funzionalità, tutte incentrate sul grado in cui una scommessa si aspettava generasse un rendimento maggiore rispetto a un'altra, sottolineano la complessità del processo decisionale umano. È importante sottolineare che lo studio ha evidenziato come il comportamento di scelta nel dataset Choices13k apparisse meno sensibile a queste funzionalità rispetto al dataset CPC15, suggerendo che i partecipanti online abbiano dimostrato maggiore rumore o indifferenza nel loro processo decisionale. Questa comprensione sfumata del bias del dataset e delle sue radici getta le basi per lo sviluppo di strategie per mitigarne l'impatto e affinare i modelli predittivi in contesti decisionali diversificati.
Analisi delle funzionalità e proposta di un modello ibrido
Con una comprensione completa del bias del dataset e delle sue implicazioni, i ricercatori hanno proposto una soluzione innovativa: un modello ibrido. Questo modello mirava ad affrontare l'aumento del rumore decisionale osservato nei dataset online, introducendo un modello generativo probabilistico insieme a una rete neurale addestrata sul dataset CPC15. Il modello generativo probabilistico assumeva che una proporzione di partecipanti nell'esperimento online stesse facendo indovini casuali, mentre i partecipanti rimanenti seguivano i modelli decisionali appresi dal dataset di laboratorio.
L'integrazione di questo modello ibrido ha migliorato significativamente l'accuratezza della previsione e ridotto le differenze osservate rispetto alla tradizionale rete neurale addestrata esclusivamente sul dataset CPC15. Questo approccio innovativo non solo ha fornito una soluzione pratica al problema del bias del dataset, ma ha anche evidenziato l'importanza di considerare le caratteristiche uniche dei dataset online nello sviluppo di modelli predittivi accurati e robusti per il processo decisionale umano.
La ricerca ha mostrato la relazione intricata tra modelli ML e dataset di decisioni umane, sottolineando la presenza e l'impatto del bias del dataset. Lo studio ha evidenziato le sfide poste dall'affidarsi esclusivamente a dataset online su larga scala per comprendere le teorie generali del processo decisionale umano.
Ha sottolineato la necessità di un approccio equilibrato, che combini tecniche di machine learning, analisi dei dati e ragionamento guidato dalla teoria per navigare nelle complessità delle scelte rischiose umane. Man mano che la ricerca apre nuove strade per esplorazioni future, emergono domande: come possiamo affinare e validare i modelli di machine learning per tenere conto della variabilità e del rumore intrinseci nei dati online, aprendo la strada a una comprensione più robusta del processo decisionale umano in diversi contesti e impostazioni sperimentali? La ricerca di risposte continua, esortando i ricercatori a esplorare, affinare e integrare quadri teorici e analitici per svelare i misteri del processo decisionale umano in un'era sempre più digitale.
Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Aamir Sheikh
Aamir è un giornalista tecnologico con quasi sei anni di esperienza nei settori delle criptovalute e della tecnologia. Si è laureato presso l'Università MAJ con un MBA in Finanza e Marketing. Attualmente lavora per Cryptopolitan, dove si occupa delle ultime novità sui mercati delle criptovalute e delle previsioni sui prezzi.
















