DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Décrypter le biais des ensembles de données – L'apprentissage automatique révèle les failles dans les choix risqués humains

ParAamir SheikhAamir Sheikh 3 min de lecture
Biais des ensembles de données
  • Des chercheurs de l'Université technique de Darmstadt mettent en évidence un biais dans les ensembles de données concernant les choix risqués humains grâce à l'apprentissage automatique.
  • L'étude examine les différences entre les choix en ligne et en laboratoire, proposant un modèle hybride pour contrer l'augmentation du bruit décisionnel.
  • Les défis liés à l'utilisation d'ensembles de données en ligne à grande échelle émergent, appelant à un équilibre prudent entre théorie et analyse des données pour comprendre la prise de décision humaine.

Des chercheurs de l'Université technique de Darmstadt et du Centre hessois pour l'intelligence artificielle, en Allemagne, ont exploré la relation complexe entre les ensembles de données et les modèles pour comprendre les choix risqués humains. 

Leurs résultats, publiés dans la revue Nature Human Behaviour, révèlent la présence d'un biais dans les ensembles de données, éclairant les différences subtiles dans les comportements de décision entre les participants aux expériences en ligne et ceux en laboratoire. En utilisant des techniques avancées d'apprentissage automatique, les chercheurs ont non seulement identifié ce biais, mais ont également proposé un modèle hybride novateur pour combler l'écart créé par le bruit décisionnel accru dans les ensembles de données en ligne.

L'interaction entre les ensembles de données de décision et les modèles d'apprentissage automatique

Comprendre l'interaction entre les ensembles de données de décision et les modèles d'apprentissage automatique (ML) est crucial pour démêler les complexités de la prise de décision humaine. La recherche menée par l'équipe allemande examine systématiquement cette relation, en utilisant trois ensembles de données distincts : Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) et Choices13k. 

Ces ensembles de données représentent un spectre de choix effectués par des participants dans des environnements de laboratoire contrôlés et lors d'expériences en ligne à grande échelle. L'équipe de recherche a utilisé divers modèles d'apprentissage automatique, y compris des méthodes classiques et des architectures de réseaux neuronaux, les entraînant sur ces ensembles de données pour obtenir des insights sur les variations de performance et les biais.

En approfondissant l'analyse, l'étude a révélé que les modèles entraînés sur l'ensemble de données Choices13k, indicatif d'expériences en ligne, présentaient une mauvaise généralisation lorsqu'ils étaient appliqués à des ensembles de données de laboratoire plus petits (CPC15 et CPC18). De même, les modèles entraînés sur CPC15 ne transféraient pas de manière transparente leur pouvoir prédictif vers l'ensemble de données Choices13k, révélant un biais systématique dans les ensembles de données. 

Ce biais pointait des différences notables dans les comportements de choix entre les participants aux expériences en laboratoire et ceux participant en ligne. Ces résultats soulignent l'importance de reconnaître et de traiter le biais des ensembles de données, surtout lorsqu'on traite de contextes et de sources de données diversifiés.

Démasquer le biais des ensembles de données

La révélation du biais des ensembles de données invite à une enquête plus approfondie sur ses racines et ses implications. L'étude a découvert que les modèles entraînés sur l'ensemble de données Choices13k faisaient preuve d'une réticence à prédire des proportions extrêmes de choix, indiquant un schéma de prise de décision distinctif chez les participants en ligne par rapport à leurs homologues en laboratoire. 

Pour disséquer la source de ce biais, les chercheurs ont analysé méticuleusement les caractéristiques des paris qui prédisaient la différence de comportement de choix entre les ensembles de données. En utilisant des techniques telles que les régressions linéaires et les explications additives de SHapley (SHAP), ils ont quantifié l'importance de chaque caractéristique. De manière surprenante, les caractéristiques issues de la littérature en psychologie et en économie comportementale, telles que la domination stochastique, la probabilité de gagner et la différence de valeur attendue, ont joué un rôle pivot dans l'influence du biais.

Ces caractéristiques, toutes centrées sur le degré auquel un pari était censé produire un rendement plus élevé par rapport à un autre, soulignent la complexité de la prise de décision humaine. Il est important de noter que l'étude a mis en évidence que le comportement de choix dans l'ensemble de données Choices13k semblait moins sensible à ces caractéristiques que dans l'ensemble CPC15, suggérant que les participants en ligne faisaient preuve de plus de bruit ou d'indifférence dans leur prise de décision. Cette compréhension nuancée du biais des ensembles de données et de ses racines prépare le terrain pour le développement de stratégies visant à atténuer son impact et à affiner les modèles prédictifs dans divers contextes de prise de décision.

Analyse des caractéristiques et proposition d'un modèle hybride

Avec une compréhension complète du biais des ensembles de données et de ses implications, les chercheurs ont proposé une solution novatrice : un modèle hybride. Ce modèle visait à adresser le bruit décisionnel accru observé dans les ensembles de données en ligne, introduisant un modèle génératif probabiliste aux côtés d'un réseau neuronal entraîné sur l'ensemble de données CPC15. Le modèle génératif probabiliste supposait qu'une proportion de participants à l'expérience en ligne faisait des devinettes aléatoires, tandis que les participants restants suivaient les schémas de décision appris à partir de l'ensemble de données de laboratoire.

L'intégration de ce modèle hybride a considérablement amélioré la précision des prédictions et réduit les différences observées avec le réseau neuronal traditionnel entraîné uniquement sur l'ensemble de données CPC15. Cette approche innovante a non seulement fourni une solution pratique au problème du biais des ensembles de données, mais a également souligné l'importance de prendre en compte les caractéristiques uniques des ensembles de données en ligne pour développer des modèles prédictifs précis et robustes pour la prise de décision humaine.

La recherche a mis en évidence la relation complexe entre les modèles d'apprentissage automatique et les ensembles de données de prise de décision humaine, soulignant la présence et l'impact des biais dans les ensembles de données. L'étude a mis en lumière les défis posés par la dépendance exclusive aux grands ensembles de données en ligne pour comprendre les théories générales de la prise de décision humaine.

Cela a souligné la nécessité d'une approche équilibrée, combinant les techniques d'apprentissage automatique, l'analyse de données et le raisonnement théorique pour naviguer dans les complexités des choix risqués humains. Alors que la recherche ouvre des voies pour de futures explorations, des questions émergent : Comment pouvons-nous affiner et valider les modèles d'apprentissage automatique pour tenir compte de la variabilité et du bruit inhérents aux données en ligne, ouvrant la voie à une compréhension plus robuste de la prise de décision humaine dans différents contextes et paramètres expérimentaux ? La quête de réponses se poursuit, incitant les chercheurs à explorer, affiner et intégrer des cadres théoriques et analytiques pour démêler les mystères de la prise de décision humaine à l'ère numérique croissante.

Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Aamir Sheikh

Aamir Sheikh

Aamir est journaliste technologique avec près de six ans d'expérience dans les secteurs de la cryptomonnaie et de la technologie. Il est diplômé de l'université MAJ avec un MBA en finance et marketing. Il travaille désormais pour Cryptopolitan, où il rend compte des dernières évolutions des marchés de la cryptomonnaie et des prévisions de prix.

PLUS D'ACTUALITÉS…