Descifrando el sesgo de los conjuntos de datos: el aprendizaje automático revela grietas en las decisiones arriesgadas humanas

- Investigadores de la Universidad Técnica de Darmstadt revelan un sesgo en los conjuntos de datos sobre las decisiones arriesgadas humanas mediante el uso de aprendizaje automático.
- El estudio aborda las diferencias entre las elecciones en línea y de laboratorio, introduciendo un modelo híbrido para contrarrestar el aumento del ruido en la toma de decisiones.
- Surgen desafíos al confiar en conjuntos de datos en línea a gran escala, lo que urge un equilibrio cuidadoso entre la teoría y el análisis de datos para comprender la toma de decisiones humanas.
Investigadores de la Universidad Técnica de Darmstadt y del Centro Hessian para la Inteligencia Artificial, Alemania, han profundizado en la intrincada relación entre los conjuntos de datos y los modelos para comprender las decisiones arriesgadas humanas.
Sus hallazgos, publicados en la revista Nature Human Behaviour, ponen de manifiesto la presencia de un sesgo en los conjuntos de datos, aclarando las diferencias matizadas en los comportamientos de decisión entre los participantes en experimentos en línea y en laboratorio. Empleando técnicas avanzadas de aprendizaje automático, los investigadores no solo identifican el sesgo, sino que también proponen un modelo híbrido novedoso para cerrar la brecha creada por el mayor ruido de decisión en los conjuntos de datos en línea.
La interacción entre los conjuntos de datos de decisiones y los modelos de aprendizaje automático
Comprender la interacción entre los conjuntos de datos de decisiones y los modelos de aprendizaje automático (ML) es crucial para desentrañar las complejidades de la toma de decisiones humanas. La investigación realizada por el equipo alemán examina sistemáticamente esta relación, utilizando tres conjuntos de datos distintivos: Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) y Choices13k.
Estos conjuntos de datos representan un espectro de elecciones realizadas por participantes tanto en entornos de laboratorio controlados como en experimentos en línea a gran escala. El equipo de investigación empleó varios modelos de aprendizaje automático, incluyendo métodos clásicos y arquitecturas de redes neuronales, entrenándolos con estos conjuntos de datos para obtener información sobre las variaciones de rendimiento y los sesgos.
Profundizando, el estudio encontró que los modelos entrenados con el conjunto de datos Choices13k, indicativo de experimentos en línea, mostraron una mala generalización cuando se aplicaron a conjuntos de datos de laboratorio más pequeños (CPC15 y CPC18). Del mismo modo, los modelos entrenados en CPC15 no transferían sin problemas su poder predictivo al conjunto de datos Choices13k, revelando un sesgo sistemático del conjunto de datos.
Este sesgo apuntaba a diferencias notables en los comportamientos de elección entre los participantes en experimentos de laboratorio y aquellos que participaban en línea. Estos hallazgos subrayan la importancia de reconocer y abordar el sesgo de los conjuntos de datos, especialmente al tratar con contextos y fuentes de datos diversas.
Desentrañando el sesgo de los conjuntos de datos
La revelación del sesgo de los conjuntos de datos impulsa una investigación más profunda sobre sus raíces e implicaciones. El estudio descubrió que los modelos entrenados con el conjunto de datos Choices13k mostraban una renuencia a predecir proporciones extremas de elección, lo que indica un patrón de toma de decisiones distintivo en los participantes en línea en comparación con sus contrapartes de laboratorio.
Para diseccionar la fuente de este sesgo, los investigadores analizaron meticulosamente las características de las apuestas que eran predictivas de la diferencia en el comportamiento de elección entre los conjuntos de datos. Utilizando técnicas como regresiones lineales y SHapley Additive exPlanations (SHAP), cuantificaron la importancia de cada característica. Sorprendentemente, características de la literatura de psicología y economía conductual, como la dominancia estocástica, la probabilidad de ganar y la diferencia en el valor esperado, jugaron un papel crucial en la influencia del sesgo.
Estas características, todas ellas centradas en el grado en que se esperaba que una apuesta produjera un pago mayor en comparación con otra, subrayaron la complejidad de la toma de decisiones humanas. Es importante destacar que el estudio señaló que el comportamiento de elección en el conjunto de datos Choices13k parecía menos sensible a estas características que en el conjunto de datos CPC15, lo que sugiere que los participantes en línea demostraron más ruido o indiferencia en su toma de decisiones. Esta comprensión matizada del sesgo de los conjuntos de datos y sus raíces sienta las bases para el desarrollo de estrategias para mitigar su impacto y refinar los modelos predictivos en diversos contextos de toma de decisiones.
Analizando características y proponiendo un modelo híbrido
Con una comprensión integral del sesgo de los conjuntos de datos y sus implicaciones, los investigadores propusieron una solución novedosa: un modelo híbrido. Este modelo tenía como objetivo abordar el mayor ruido de decisión observado en los conjuntos de datos en línea, introduciendo un modelo generativo probabilístico junto con una red neuronal entrenada en el conjunto de datos CPC15. El modelo generativo probabilístico asumía que una proporción de los participantes en el experimento en línea estaban haciendo conjeturas aleatorias, mientras que los participantes restantes seguían los patrones de decisión aprendidos del conjunto de datos de laboratorio.
La integración de este modelo híbrido mejoró significativamente la precisión de la predicción y redujo las diferencias observadas con la red neuronal tradicional entrenada únicamente en el conjunto de datos CPC15. Este enfoque innovador no solo proporcionó una solución práctica al problema del sesgo de los conjuntos de datos, sino que también destacó la importancia de considerar las características únicas de los conjuntos de datos en línea en el desarrollo de modelos predictivos precisos y robustos para la toma de decisiones humanas.
La investigación mostró la intrincada relación entre los modelos de aprendizaje automático y los conjuntos de datos de decisiones humanas, enfatizando la presencia e impacto del sesgo de los conjuntos de datos. El estudio destacó los desafíos planteados por depender únicamente de conjuntos de datos en línea a gran escala para comprender las teorías generales de la toma de decisiones humanas.
Subrayó la necesidad de un enfoque equilibrado, combinando técnicas de aprendizaje automático, análisis de datos y razonamiento basado en teorías para navegar las complejidades de las decisiones arriesgadas humanas. A medida que la investigación abre vías para futuras exploraciones, surgen preguntas: ¿Cómo podemos refinar y validar los modelos de aprendizaje automático para tener en cuenta la variabilidad y el ruido inherentes a los datos en línea, allanando el camino para una comprensión más robusta de la toma de decisiones humanas en diferentes contextos y entornos experimentales? La búsqueda de respuestas continúa, instando a los investigadores a explorar, refinar e integrar marcos teóricos y analíticos para desentrañar los misterios de la toma de decisiones humanas en una era cada vez más digital.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Aamir Sheikh
Aamir es un periodista tecnológico con casi seis años de experiencia en los sectores de criptomonedas y tecnología. Se graduó de la Universidad MAJ con un MBA en Finanzas y Marketing. Ahora trabaja con Cryptopolitan, donde informa sobre los últimos desarrollos en los mercados de criptomonedas y predicciones de precios.
















