Entschlüsselung der Datensatzverzerrung – Maschinelles Lernen enthüllt Risse in menschlichen risikobehafteten Entscheidungen

- Forscher der Technischen Universität Darmstadt enthüllen eine Datensatzverzerrung bei menschlichen risikobehafteten Entscheidungen mithilfe von maschinellem Lernen.
- Die Studie untersucht Unterschiede zwischen Online- und Laborentscheidungen und stellt ein Hybridmodell vor, um die zunehmende Entscheidungsrauschen zu reduzieren.
- Herausforderungen beim Verlassen auf großflächige Online-Datensätze treten zutage und erfordern eine sorgfältige Balance zwischen Theorie und Datenanalyse zum Verständnis menschlicher Entscheidungsfindung.
Forscher der Technischen Universität Darmstadt und des Hessischen Zentrums für Künstliche Intelligenz in Deutschland haben die komplexe Beziehung zwischen Datensätzen und Modellen beim Verständnis menschlicher risikobehafteter Entscheidungen untersucht.
Ihre Ergebnisse, veröffentlicht in der Zeitschrift Nature Human Behaviour, machen das Vorhandensein von Datensatzverzerrungen sichtbar und werfen Licht auf die nuancierten Unterschiede im Entscheidungsverhalten zwischen Teilnehmern, die an Online- und Laborexperimenten teilgenommen haben. Durch den Einsatz fortschrittlicher maschineller Lerntechniken identifizieren die Forscher nicht nur die Verzerrung, sondern schlagen auch ein neues hybrides Modell vor, um die Lücke zu schließen, die durch erhöhte Entscheidungslärm in Online-Datensätzen entstanden ist.
Das Zusammenspiel von Entscheidungsdatensätzen und ML-Modellen
Das Verständnis des Zusammenspiels zwischen Entscheidungsdatensätzen und Machine-Learning-(ML)-Modellen ist entscheidend, um die Komplexität menschlicher Entscheidungsfindung zu entschlüsseln. Die von der deutschen Mannschaft durchgeführte Forschung untersucht diese Beziehung systematisch und nutzt drei unterschiedliche Datensätze: Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) und Choices13k.
Diese Datensätze repräsentieren ein Spektrum von Entscheidungen, die von Teilnehmern sowohl in kontrollierten Laborumgebungen als auch in großflächigen Online-Experimenten getroffen wurden. Das Forschungsteam verwendete verschiedene ML-Modelle, einschließlich klassischer Methoden und neuronaler Netzwerkarchitekturen, und trainierte sie an diesen Datensätzen, um Einblicke in die Leistungsunterschiede und Verzerrungen zu gewinnen.
Bei tiefergehender Untersuchung stellte die Studie fest, dass Modelle, die an den Choices13k-Datensatz (repräsentativ für Online-Experimente) trainiert wurden, eine schlechte Verallgemeinerung aufzeigten, wenn sie auf kleinere Labordatensätze (CPC15 und CPC18) angewendet wurden. Ebenso übertrugen Modelle, die an CPC15 trainiert wurden, ihre Vorhersagekraft nicht nahtlos auf den Choices13k-Datensatz, was eine systematische Datensatzverzerrung offenbarte.
Diese Verzerrung wies auf bemerkenswerte Unterschiede im Entscheidungsverhalten zwischen Teilnehmern hin, die an Laborexperimenten teilnahmen, und solchen, die online teilnahmen. Diese Erkenntnisse unterstreichen die Bedeutung der Anerkennung und Bewältigung von Datensatzverzerrungen, insbesondere beim Umgang mit vielfältigen Kontexten und Datenquellen.
Auflösung der Datensatzverzerrung
Die Enthüllung der Datensatzverzerrung führt zu weiteren Untersuchungen ihrer Wurzeln und Implikationen. Die Studie ergab, dass Modelle, die an den Choices13k-Datensatz trainiert wurden, eine Zurückhaltung zeigten, extreme Wahlanteile vorherzusagen, was auf ein unterscheidbares Entscheidungsverteilungsmuster bei Online-Teilnehmern im Vergleich zu ihren Laborpendants hindeutet.
Um die Quelle dieser Verzerrung zu analysieren, untersuchten die Forscher sorgfältig die Merkmale von Wetten, die für den Unterschied im Entscheidungsverhalten zwischen den Datensätzen prädiktiv waren. Durch den Einsatz von Techniken wie linearen Regressionen und SHapley Additive exPlanations (SHAP) quantifizierten sie die Bedeutung jedes Merkmals. Überraschenderweise spielten Merkmale aus der Psychologie- und Verhaltensökonomieliteratur, wie stochastische Dominanz, Gewinnwahrscheinlichkeit und der Unterschied im erwarteten Wert, eine entscheidende Rolle bei der Beeinflussung der Verzerrung.
Diese Merkmale, die alle um den Grad kreisen, in dem eine Wette im Vergleich zu einer anderen eine höhere Auszahlung erwarten ließ, unterstrichen die Komplexität der menschlichen Entscheidungsfindung. Wichtig ist, dass die Studie hervorhob, dass das Entscheidungsverhalten im Choices13k-Datensatz weniger empfindlich auf diese Merkmale reagierte als im CPC15-Datensatz, was darauf hindeutet, dass Online-Teilnehmer bei ihrer Entscheidungsfindung mehr Rauschen oder Gleichgültigkeit zeigten. Dieses nuancierte Verständnis der Datensatzverzerrung und ihrer Wurzeln bereitet den Boden für die Entwicklung von Strategien zur Minderung ihrer Auswirkungen und zur Verfeinerung von Vorhersagemodellen in verschiedenen Entscheidungskontexten vor.
Analyse von Merkmalen und Vorschlag eines hybriden Modells
Mit einem umfassenden Verständnis der Datensatzverzerrung und ihrer Implikationen schlugen die Forscher eine novel Lösung vor – ein hybrides Modell. Dieses Modell zielte darauf ab, den in Online-Datensätzen beobachteten erhöhten Entscheidungslärm zu adressieren, indem es ein probabilistisches generatives Modell neben einem neuronalen Netzwerk einführte, das an den CPC15-Datensatz trainiert wurde. Das probabilistische generative Modell ging davon aus, dass ein Anteil der Teilnehmer im Online-Experiment zufällige Vermutungen anstellte, während die restlichen Teilnehmer den aus dem Labordatensatz gelernten Entscheidungsmustern folgten.
Die Integration dieses hybriden Modells hat die Vorhersagegenauigkeit erheblich verbessert und die beobachteten Unterschiede zum traditionellen, ausschließlich mit dem CPC15-Datensatz trainierten neuronalen Netzwerk verringert. Dieser innovative Ansatz bietet nicht nur eine praktische Lösung für das Problem der Datensatzverzerrung, sondern unterstreicht auch die Bedeutung der Berücksichtigung der einzigartigen Merkmale von Online-Datensätzen bei der Entwicklung genauer und robuster prädiktiver Modelle für menschliche Entscheidungsfindung.
Die Forschung zeigte die komplexe Beziehung zwischen ML-Modellen und menschlichen Entscheidungsdatensätzen auf und betonte das Vorhandensein und die Auswirkungen von Datensatzverzerrungen. Die Studie hob die Herausforderungen hervor, die sich aus der ausschließlichen Verlassung auf großflächige Online-Datensätze zum Verständnis allgemeiner Theorien menschlicher Entscheidungsfindung ergeben.
Dies unterstrich die Notwendigkeit eines ausgewogenen Ansatzes, der ML-Techniken, Datenanalyse und theoriegeleitete Schlussfolgerungen kombiniert, um die Komplexität menschlicher risikobehafteter Entscheidungen zu bewältigen. Da die Forschung neue Wege für zukünftige Untersuchungen eröffnet, stellen sich Fragen: Wie können wir ML-Modelle verfeinern und validieren, um die Variabilität und das Rauschen zu berücksichtigen, die Online-Daten inhärent sind, und so den Weg für ein robusteres Verständnis der menschlichen Entscheidungsfindung in verschiedenen Kontexten und experimentellen Settings ebnen? Die Suche nach Antworten geht weiter und fordert Forscher auf, theoretische und analytische Rahmenwerke zu erforschen, zu verfeinern und zu integrieren, um die Geheimnisse der menschlichen Entscheidungsfindung in einem zunehmend digitalen Zeitalter zu lüften.
Lesen Sie nicht nur Krypto-Nachrichten. Verstehen Sie sie. Abonnieren Sie unseren Newsletter. Es ist kostenlos.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Aamir Sheikh
Aamir ist Tech-Journalist mit fast sechs Jahren Erfahrung in der Krypto- und Technologiebranche. Er absolvierte sein Studium an der MAJ University mit einem MBA in Finanzen und Marketing. Heute arbeitet er für Cryptopolitan, wo er über die neuesten Entwicklungen in den Kryptowährungsmärkten und Preisprognosen berichtet.
















