Расшифровка смещения в наборах данных: машинное обучение вскрывает разрывы в рискованных решениях людей

- Исследователи из Технического университета Дармштадта выявили смещение в наборах данных, связанных с рискованными решениями людей, с помощью машинного обучения.
- В исследовании рассматриваются различия между онлайн- и лабораторными выборами, а также представлен гибридная модель для снижения уровня шума при принятии решений.
- Проблемы, возникающие при опоре на крупномасштабные онлайн-наборы данных, требуют тщательного баланса между теорией и анализом данных для понимания механизмов принятия решений людьми.
Исследователи из Технического университета Дармштадта и Гессенского центра искусственного интеллекта (Германия) глубоко изучили сложную взаимосвязь между наборами данных и моделями в контексте понимания рискованных решений людей.
Их результаты, опубликованные в журнале Nature Human Behaviour, выявили наличие смещения в наборах данных, проливая свет на тонкие различия в поведении при принятии решений между участниками онлайн-экспериментов и лабораторных исследований. Используя передовые методы машинного обучения, исследователи не только выявили это смещение, но и предложили новую гибридную модель для устранения разрыва, вызванного повышенным уровнем «шума» в решениях в онлайн-наборах данных.
Взаимодействие наборов данных о решениях и моделей машинного обучения
Понимание взаимодействия между наборами данных о решениях и моделями машинного обучения (ML) имеет решающее значение для раскрытия сложностей человеческого принятия решений. Исследование, проведенное немецкой командой, систематически изучает эту взаимосвязь, используя три различных набора данных: Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) и Choices13k.
Эти наборы данных отражают спектр выборов, сделанных участниками как в контролируемых лабораторных условиях, так и в крупномасштабных онлайн-экспериментах. Исследовательская команда применяла различные модели машинного обучения, включая классические методы и архитектуры нейронных сетей, обучая их на этих наборах данных, чтобы получить представление об изменениях в производительности и смещениях.
При более глубоком анализе исследование показало, что модели, обученные на наборе данных Choices13k (характерном для онлайн-экспериментов), демонстрировали плохую обобщающую способность при применении к меньшим лабораторным наборам данных (CPC15 и CPC18). Аналогично, модели, обученные на CPC15, не могли бесшовно перенести свою предсказательную силу на набор данных Choices13k, что выявило систематическое смещение в наборах данных.
Это смещение указывало на заметные различия в поведении при выборе между участниками лабораторных экспериментов и теми, кто участвовал онлайн. Эти выводы подчеркивают важность признания и устранения смещения в наборах данных, особенно при работе с разнообразными контекстами и источниками данных.
Распутывание узла смещения в наборах данных
Выявление смещения в наборах данных побуждает к дальнейшему исследованию его корней и последствий. В ходе исследования было обнаружено, что модели, обученные на наборе данных Choices13k, проявляли нежелание предсказывать экстремальные пропорции выборов, что указывает на отличительный паттерн принятия решений у онлайн-участников по сравнению с их лабораторными коллегами.
Чтобы разобраться в источнике этого смещения, исследователи тщательно проанализировали особенности ставок (gambles), которые предсказывали разницу в поведении при выборе между наборами данных. Используя такие методы, как линейная регрессия и объяснимые аддитивные модели SHAP (SHapley Additive exPlanations), они количественно оценили важность каждой особенности. Удивительно, но особенности из литературы по психологии и поведенческой экономике, такие как стохастическое доминирование, вероятность выигрыша и разница в ожидаемой стоимости, сыграли ключевую роль во влиянии на это смещение.
Эти особенности, все вращающиеся вокруг степени, в которой одна ставка, как ожидалось, принесет более высокую выплату по сравнению с другой, подчеркивают сложность человеческого принятия решений. Важно отметить, что исследование показало, что поведение при выборе в наборе данных Choices13k было менее чувствительно к этим особенностям, чем в наборе CPC15, что предполагает, что онлайн-участники демонстрировали больше «шума» или безразличия в своих решениях. Это тонкое понимание смещения в наборах данных и его корней создает основу для разработки стратегий по смягчению его воздействия и уточнению предсказательных моделей в различных контекстах принятия решений.
Анализ особенностей и предложение гибридной модели
Обладая всесторонним пониманием смещения в наборах данных и его последствий, исследователи предложили новое решение — гибридную модель. Эта модель была направлена на устранение повышенного уровня «шума» в решениях, наблюдаемого в онлайн-наборах данных, вводя вероятностную генеративную модель наряду с нейронной сетью, обученной на наборе данных CPC15. Вероятностная генеративная модель предполагала, что часть участников онлайн-эксперимента делала случайные предположения, в то время как остальные участники следовали паттернам принятия решений, изученным на основе лабораторного набора данных.
Интеграция этой гибридной модели значительно улучшила точность предсказаний и снизила наблюдаемые различия по сравнению с традиционной нейронной сетью, обученной исключительно на наборе данных CPC15. Этот инновационный подход не только предложил практическое решение проблемы смещения в наборах данных, но и подчеркнул важность учета уникальных характеристик онлайн-наборов данных при разработке точных и надежных предсказательных моделей для человеческого принятия решений.
Исследование продемонстрировало сложную взаимосвязь между моделями машинного обучения и наборами данных о человеческих решениях, подчеркнув наличие и влияние смещения данных (dataset bias). В работе были выделены проблемы, возникающие при опоре исключительно на крупномасштабные онлайн-наборы данных для понимания общих теорий человеческого принятия решений.
Это подчеркнуло необходимость сбалансированного подхода, сочетающего методы машинного обучения, анализ данных и теоретические рассуждения для навигации в сложностях рискованных человеческих решений. По мере того как исследование открывает пути для будущих исследований, возникают вопросы: как мы можем уточнить и проверить модели машинного обучения, чтобы учесть изменчивость и «шум», присущие онлайн-данным, прокладывая путь к более надежному пониманию человеческого принятия решений в различных контекстах и экспериментальных условиях? Поиск ответов продолжается, побуждая исследователей изучать, уточнять и интегрировать теоретические и аналитические рамки, чтобы раскрыть тайны человеческого принятия решений в все более цифровую эпоху.
Не просто читайте новости о криптовалютах. Понимайте их. Подпишитесь на нашу рассылку. Это бесплатно.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Амир Шейх
Амир — технологический журналист с почти шестилетним опытом работы в индустриях криптовалют и технологий. Он окончил университет MAJ, получив степень MBA по финансам и маркетингу. Сейчас он работает в Cryptopolitan, где освещает последние события на рынке криптовалют и прогнозы цен.
















