ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Descodificar o Viés dos Dados – O Machine Learning Revela Fissuras nas Escolhas de Risco Humanas

PorAamir SheikhAamir Sheikh 3 min de leitura
Viés em Conjuntos de Dados
  • Pesquisadores da Universidade Técnica de Darmstadt revelam vieses de dados em escolhas arriscadas humanas usando aprendizado de máquina.
  • O estudo aborda diferenças entre escolhas online e de laboratório, introduzindo um modelo híbrido para combater o aumento do ruído na tomada de decisão.
  • Desafios ao depender de grandes conjuntos de dados online emergem, exigindo um equilíbrio cuidadoso entre teoria e análise de dados para compreender a tomada de decisão humana.

Investigadores da Universidade Técnica de Darmstadt e do Centro Hessian para a Inteligência Artificial, na Alemanha, aprofundaram a relação intrincada entre conjuntos de dados e modelos para compreender as escolhas de risco humanas. 

As suas descobertas, publicadas na revista Nature Human Behaviour, revelam a presença de viés nos dados, lançando luz sobre as diferenças subtis nos comportamentos de decisão entre participantes envolvidos em experiências online e em laboratório. Utilizando técnicas avançadas de machine learning, os investigadores não só identificam o viés, como também propõem um modelo híbrido inovador para colmatar a lacuna criada pelo aumento do ruído nas decisões nos conjuntos de dados online.

A interação entre conjuntos de dados de decisão e modelos de ML

Compreender a interação entre conjuntos de dados de decisão e modelos de machine learning (ML) é crucial para desvendar as complexidades da tomada de decisão humana. A investigação conduzida pela equipa alemã examina sistematicamente esta relação, utilizando três conjuntos de dados distintos: Choice Prediction Competition 2015 (CPC15), Choice Prediction Competition 2018 (CPC18) e Choices13k. 

Estes conjuntos de dados representam um espectro de escolhas feitas por participantes tanto em ambientes laboratoriais controlados como em experiências online em larga escala. A equipa de investigação utilizou vários modelos de ML, incluindo métodos clássicos e arquiteturas de redes neurais, treinando-os nestes conjuntos de dados para obter insights sobre as variações de desempenho e os vieses.

Aprofundando a análise, o estudo descobriu que os modelos treinados no conjunto de dados Choices13k, indicativo de experiências online, apresentaram uma generalização deficiente quando aplicados a conjuntos de dados laboratoriais mais pequenos (CPC15 e CPC18). Da mesma forma, os modelos treinados no CPC15 não transferiram seamless o seu poder preditivo para o conjunto de dados Choices13k, revelando um viés sistemático nos dados. 

Este viés apontava para diferenças notáveis nos comportamentos de escolha entre participantes envolvidos em experiências laboratoriais e aqueles que participavam online. Estas descobertas sublinham a importância de reconhecer e abordar o viés dos dados, especialmente ao lidar com contextos e fontes de dados diversas.

Desvendando o viés dos dados

A revelação do viés nos dados suscita uma investigação mais aprofundada sobre as suas raízes e implicações. O estudo descobriu que os modelos treinados no conjunto de dados Choices13k exibiam uma relutância em prever proporções extremas de escolha, indicando um padrão de tomada de decisão distinto nos participantes online em comparação com os seus homólogos laboratoriais. 

Para dissecar a origem deste viés, os investigadores analisaram meticulosamente as características das apostas que eram preditivas da diferença no comportamento de escolha entre os conjuntos de dados. Utilizando técnicas como regressões lineares e Explicações Aditivas de SHapley (SHAP), quantificaram a importância de cada característica. Surpreendentemente, características da literatura de psicologia e economia comportamental, como a dominância estocástica, a probabilidade de vitória e a diferença no valor esperado, desempenharam um papel pivotal na influência do viés.

Estas características, todas relacionadas com o grau em que uma aposta se esperava que rendesse um pagamento superior em comparação com outra, sublinharam a complexidade da tomada de decisão humana. Importa destacar que o estudo realçou que o comportamento de escolha no conjunto de dados Choices13k parecia menos sensível a estas características do que no conjunto de dados CPC15, sugerindo que os participantes online demonstraram mais ruído ou indiferença na sua tomada de decisão. Esta compreensão subtil do viés dos dados e das suas raízes prepara o terreno para o desenvolvimento de estratégias para mitigar o seu impacto e refinar os modelos preditivos em contextos diversos de tomada de decisão.

Analisando características e propondo um modelo híbrido

Com uma compreensão abrangente do viés dos dados e das suas implicações, os investigadores propuseram uma solução inovadora – um modelo híbrido. Este modelo visava abordar o aumento do ruído nas decisões observado nos conjuntos de dados online, introduzindo um modelo gerativo probabilístico juntamente com uma rede neural treinada no conjunto de dados CPC15. O modelo gerativo probabilístico assumia que uma proporção dos participantes no experimento online estava a fazer palpites aleatórios, enquanto os restantes participantes seguiam os padrões de decisão aprendidos a partir do conjunto de dados laboratorial.

A integração deste modelo híbrido melhorou significativamente a precisão da previsão e reduziu as diferenças observadas em comparação com a rede neural tradicional treinada apenas no conjunto de dados CPC15. Esta abordagem inovadora não só forneceu uma solução prática para o problema do viés dos dados, como também realçou a importância de considerar as características únicas dos conjuntos de dados online no desenvolvimento de modelos preditivos precisos e robustos para a tomada de decisão humana.

A investigação apresentou a relação intrincada entre modelos de ML e conjuntos de dados de decisão humana, enfatizando a presença e o impacto do viés dos dados. O estudo destacou os desafios impostos pela dependência exclusiva de conjuntos de dados online em larga escala para compreender teorias gerais da tomada de decisão humana.

Sublinhou a necessidade de uma abordagem equilibrada, combinando técnicas de ML, análise de dados e raciocínio baseado em teoria para navegar pelas complexidades das escolhas de risco humanas. À medida que a investigação abre caminhos para futuras explorações, surgem questões: Como podemos refinar e validar modelos de ML para ter em conta a variabilidade e o ruído inerentes aos dados online, abrindo caminho para uma compreensão mais robusta da tomada de decisão humana em diferentes contextos e configurações experimentais? A busca por respostas continua, instigando os investigadores a explorar, refinar e integrar quadros teóricos e analíticos para desvendar os mistérios da tomada de decisão humana numa era cada vez mais digital.

Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Aamir Sheikh

Aamir Sheikh

Aamir é um jornalista de tecnologia com quase seis anos de experiência nos setores de criptomoedas e tecnologia. Formou-se na MAJ University com um MBA em Finanças e Marketing. Atualmente trabalha na Cryptopolitan, onde relata os últimos desenvolvimentos nos mercados de criptomoedas e previsões de preços.

MAIS … NOTÍCIAS