ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Desempenho da IA em Exames Difíceis de Resolução de Problemas Avaliado com Benchmark MathVista

PorJohn PalmerJohn Palmer 3 min de leitura
MathVista
  • Modelos de IA, incluindo o GPT-4V, demonstraram potencial na resolução de problemas visuais e matemáticos complexos, mas ainda ficam aquém do desempenho humano.
  • MathVista, uma nova benchmark, avalia a capacidade da IA de enfrentar desafios matemáticos orientados visualmente, enfatizando a necessidade de mais pesquisa e desenvolvimento.
  • Habilidades de resolução de problemas visuais na IA são cruciais para aplicações como veículos autônomos e têm implicações em diversos domínios.

A inteligência artificial (IA) fez avanços significativos nos últimos anos, lidando com sucesso com tarefas envolvendo texto e imagens. No entanto, seu desempenho na resolução de problemas complexos, especialmente aqueles que envolvem raciocínio matemático e contexto visual, levantou questões sobre sua confiabilidade. Embora tenham sido feitas alegações de que modelos de IA como o GPT-4 se destacam em tarefas como exames de matemática do SAT, nem todas essas afirmações resistiram ao escrutínio.

Um artigo recente até retratou sua alegação de que o GPT-4 poderia obter um grau em ciência da computação no MIT. Para obter uma compreensão mais profunda de como os modelos de IA lidam com a resolução de problemas, uma equipe de pesquisadores da Universidade da Califórnia, Los Angeles, da Universidade de Washington e da Microsoft Research desenvolveu um novo benchmark de teste chamado MathVista. Este benchmark foca em desafios orientados visualmente para avaliar as capacidades de modelos de linguagem grandes (LLMs) e modelos multimodais grandes (LMMs).

Apresentando o MathVista: Um benchmark para resolução de problemas visuais

Os pesquisadores reconheceram a necessidade de examinar sistematicamente a capacidade dos modelos fundamentais de realizar raciocínio matemático em contextos visuais. Para abordar isso, eles introduziram o MathVista, um benchmark de teste que inclui 6.141 exemplos retirados de 28 conjuntos de dados multimodais e três novos conjuntos de dados chamados IQTest, FunctionQA e PaperQA. O MathVista abrange várias formas de raciocínio, incluindo algébrico, aritmético, geométrico, lógico, numérico, científico e estatístico. Ele foca em tarefas como resposta a perguntas sobre figuras, resolução de problemas geométricos, problemas matemáticos em texto, perguntas de livros didáticos e perguntas visuais. Desenvolver o MathVista foi essencial para facilitar o avanço do raciocínio matemático com um componente visual e avaliar como diferentes modelos de IA se saem em tarefas de raciocínio.

A importância da resolução de problemas visuais para a IA

As habilidades de resolução de problemas visuais na IA são de importância primordial, especialmente em aplicações como veículos autônomos. Demonstrar a capacidade de um modelo de IA de resolver corretamente problemas visuais é crítico para garantir confiança e segurança em vários domínios.

Modelos de IA testados no MathVista

A equipe de pesquisa avaliou uma dúzia de modelos fundamentais, incluindo três modelos de linguagem grandes (LLMs): ChatGPT, GPT-4 e Claude-2, dois modelos multimodais grandes proprietários (LMMs): GPT4V e Bard, e sete LMMs de código aberto. Além dos modelos de IA, eles consideraram respostas humanas fornecidas por indivíduos com pelo menos ensino médio através do Amazon Mechanical Turk, bem como respostas aleatórias.

Modelos de IA superam o acaso aleatório

O estudo produziu alguns resultados encorajadores para profissionais de IA. Todos os LLMs e LMMs testados tiveram desempenho melhor do que o acaso aleatório, o que não é surpreendente, dado que muitas das perguntas no MathVista eram de múltipla escolha em vez de perguntas de sim ou não. O GPT-4V da OpenAI surgiu como o melhor desempenho, superando o desempenho humano em áreas específicas, particularmente em perguntas envolvendo raciocínio algébrico e desafios visuais complexos, como aqueles relacionados a tabelas e gráficos de funções.

GPT-4V fica aquém do desempenho humano

Apesar do desempenho impressionante do GPT-4V, ele ainda ficou aquém dos participantes humanos que passaram pelo mesmo teste. Enquanto o modelo de IA alcançou uma taxa de precisão de 49,9%, os participantes humanos alcançaram uma pontuação de 60,3%. Essa lacuna de 10,4% na precisão geral destaca a necessidade de melhorias adicionais na capacidade dos modelos de IA de lidar com tarefas complexas de raciocínio visual e matemático.

Implicações para o desenvolvimento da IA

As descobertas do benchmark MathVista destacam o potencial e as limitações dos modelos de IA atuais. Embora a IA tenha feito progressos significativos em vários domínios, ainda há muito espaço para melhoria em termos de lidar com desafios visuais e matemáticos complexos. Esses resultados enfatizam a importância da pesquisa e desenvolvimento contínuos para fechar a lacuna entre a IA e as capacidades de resolução de problemas humanos.

O MathVista, o benchmark recém-desenvolvido, lança luz sobre o desempenho dos modelos de IA na resolução de desafios matemáticos orientados visualmente. Embora modelos de IA como o GPT-4V tenham mostrado promessa ao superar o acaso aleatório e se destacar em áreas específicas, eles ainda têm uma lacuna significativa a ser preenchida para igualar o desempenho humano. Esta pesquisa serve como um lembrete da busca contínua para aprimorar as habilidades de resolução de problemas da IA, com implicações para aplicações que vão desde veículos autônomos até saúde e além. À medida que a IA continua a evoluir, benchmarks como o MathVista desempenharão um papel crucial na avaliação e no avanço de suas capacidades na resolução de problemas complexos.

Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

John Palmer

John Palmer

John Murangiri chegou à Cryptopolitan com habilidades em análise de mercado. John (também conhecido como JP) formou-se na Universidade de Nairobi com bacharelado em comunicação social e estudos de mídia. Ele já contribuiu anteriormente com insights sobre o mercado de criptomoedas para InsideBitcoins.com e Metacoingraph.

MAIS … NOTÍCIAS