解码数据集偏差——机器学习揭示人类风险决策中的裂痕

- 达姆施塔特工业大学的 researchers 利用机器学习揭示了人类风险选择中的数据集偏差。
- 该研究探讨了在线与实验室选择的差异,并引入混合模型以应对决策噪声的增加。
- 依赖大规模在线数据集的挑战日益显现,呼吁在理解人类决策时谨慎平衡理论与数据分析。
德国达姆施塔特工业大学和黑森州人工智能中心的研究人员深入探讨了数据集与模型在理解人类风险决策之间错综复杂的关系。
他们的研究结果发表在《自然·人类行为》期刊上,揭示了数据集偏差的存在,阐明了参与在线实验和实验室实验的参与者在决策行为上的细微差异。研究人员采用先进的机器学习技术,不仅识别了偏差,还提出了一种新颖的混合模型,以弥合在线数据集中决策噪声增加所造成的差距。
决策数据集与机器学习模型之间的相互作用
理解决策数据集与机器学习 (ML) 模型之间的相互作用,对于解开人类决策的复杂性至关重要。德国团队开展的研究系统地考察了这种关系,利用了三个独特的数据集:2015 年选择预测竞赛 (CPC15)、2018 年选择预测竞赛 (CPC18) 和 Choices13k。
这些数据集代表了参与者在受控实验室环境和大规模在线实验中做出的各种选择。研究团队采用了各种机器学习模型,包括经典方法和神经网络架构,并在这些数据集上进行训练,以深入了解性能变化和偏差。
深入研究发现,在 Choices13k 数据集(代表在线实验)上训练的模型,在应用于较小的实验室数据集(CPC15 和 CPC18)时,表现出较差的泛化能力。同样,在 CPC15 上训练的模型无法无缝将其预测能力转移到 Choices13k 数据集,揭示了系统性的数据集偏差。
这种偏差指出了参与实验室实验的参与者与在线参与者之间在选择行为上的显著差异。这些发现强调了认识和解决数据集偏差的重要性,尤其是在处理不同上下文和数据源时。
解开数据集偏差
数据集偏差的发现促使人们进一步调查其根源和影响。研究发现,在 Choices13k 数据集上训练的模型表现出预测极端选择比例的意愿较低,这表明在线参与者的决策模式与实验室参与者相比具有独特性。
为了剖析这种偏差的来源,研究人员仔细分析了赌博特征,这些特征可预测数据集之间选择行为的差异。利用线性回归和 SHapley 加性解释 (SHAP) 等技术,他们量化了每个特征的重要性。令人惊讶的是,心理学和行为经济学文献中的特征,如随机优势、获胜概率和预期价值差异,在影响偏差方面发挥了关键作用。
这些特征都围绕着一个赌注相对于另一个赌注预期产生更高回报的程度,突显了人类决策的复杂性。重要的是,研究强调 Choices13k 数据集中的选择行为对这些特征的敏感度似乎低于 CPC15 数据集,表明在线参与者在决策中表现出更多的噪声或冷漠。这种对数据集偏差及其根源的细致理解,为制定减轻其影响并在不同决策环境中完善预测模型的策略奠定了基础。
分析特征并提出混合模型
在全面了解数据集偏差及其影响后,研究人员提出了一种新颖的解决方案——混合模型。该模型旨在解决在线数据集中观察到的决策噪声增加问题,引入了一个概率生成模型,并辅以在 CPC15 数据集上训练的神经网络。概率生成模型假设在线实验中有一部分参与者是在随机猜测,而其余参与者则遵循从实验室数据集中学到的决策模式。
这种混合模型的集成显著提高了预测准确性,并减少了与仅基于 CPC15 数据集训练的传统神经网络之间观察到的差异。这种创新方法不仅为数据集偏差问题提供了实用的解决方案,还强调了在开发准确且稳健的人类决策预测模型时,考虑在线数据集独特特征的重要性。
该研究展示了 机器学习模型 与人类决策数据集之间错综复杂的关系,强调了数据集偏差的存在及其影响。研究突出了仅依赖大规模在线数据集来理解人类决策一般理论所面临的挑战。
这强调了采取平衡方法的必要性,结合机器学习技术、数据分析和理论推理,以驾驭人类风险决策的复杂性。随着研究为未来探索开辟道路,一些问题随之浮现:我们如何完善和验证机器学习模型,以解释在线数据中固有的变异性及噪声,从而为在不同上下文和实验设置中更稳健地理解人类决策铺平道路?寻找答案的旅程仍在继续,敦促研究人员探索、完善并整合理论和分析框架,以解开数字时代人类决策的奥秘。
不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。
免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

Aamir Sheikh
Aamir 是一位科技记者,在加密货币和科技行业拥有近六年的经验。他毕业于 MAJ 大学,获得金融与市场营销 MBA 学位。目前他在 Cryptopolitan 工作,报道加密货币市场的最新发展和价格预测。
















