MathVista基准测试审视AI在难题解决中的表现

- 包括 GPT-4V 在内的 AI 模型在解决复杂视觉和数学问题方面展现出潜力,但仍不及人类水平。
- MathVista 是一项新基准测试,旨在评估 AI 应对视觉导向数学挑战的能力,强调需要进一步的研究与开发。
- AI 的视觉问题解决能力对于自动驾驶等应用至关重要,并对多个领域产生深远影响。
近年来,人工智能(AI)取得了重大进展,成功处理了涉及文本和图像的任务。然而,其在解决复杂问题(特别是涉及数学推理和视觉上下文的问题)方面的表现,引发了对其可靠性的质疑。虽然有人声称GPT-4等AI模型在SAT数学考试等任务中表现出色,但并非所有这些主张都经得起推敲。
最近的一篇论文甚至撤回了其声称GPT-4可以在麻省理工学院获得计算机科学学位的说法。为了更深入地了解AI模型如何处理问题解决,来自加州大学洛杉矶分校、华盛顿大学和微软研究团队的研究人员开发了一个名为MathVista的新测试基准。该基准侧重于视觉导向的挑战,以评估大型语言模型(LLM)和大型多模态模型(LMM)的能力。
介绍MathVista:一个视觉问题解决基准
研究人员认识到需要系统地检查基础模型在视觉环境中执行数学推理的能力。为此,他们引入了MathVista,这是一个测试基准,包括从28个多模态数据集和三个新数据集(IQTest、FunctionQA和PaperQA)中抽取的6,141个示例。MathVista涵盖了各种形式的推理,包括代数、算术、几何、逻辑、数值、科学和统计。它侧重于图表问答、几何问题解决、数学应用题、教科书问题和视觉问题等任务。开发MathVista对于促进具有视觉成分的数学推理的进步以及评估不同AI模型在推理任务中的表现至关重要。
视觉问题解决对AI的重要性
AI的视觉问题解决技能至关重要,特别是在自动驾驶汽车等应用中。展示AI模型正确解决视觉问题的能力,对于确保各个领域的信任和安全至关重要。
MathVista中测试的AI模型
研究团队评估了十几个基础模型,包括三个大型语言模型(LLM):ChatGPT、GPT-4和Claude-2,两个专有大型多模态模型(LMM):GPT4V和Bard,以及七个开源LMM。除了AI模型外,他们还考虑了通过Amazon Mechanical Turk提供的高中及以上学历个人的回答,以及随机回答。
AI模型表现优于随机猜测
这项研究为AI从业者带来了一些令人鼓舞的结果。所有测试的LLM和LMM的表现都优于随机猜测,鉴于MathVista中的许多问题是多项选择题而非是非题,这并不令人惊讶。OpenAI的GPT-4V成为表现最好的模型,在特定领域超越了人类表现,特别是在涉及代数推理和复杂视觉挑战(如与表格和函数图相关的问题)方面。
GPT-4V未能达到人类表现
尽管GPT-4V的表现令人印象深刻,但它仍未能达到参与相同测试的人类参与者。AI模型的准确率为49.9%,而人类参与者的得分为60.3%。这10.4%的整体准确率差距凸显了AI模型在处理复杂视觉和数学推理任务方面仍需进一步改进。
对AI发展的影响
MathVista基准测试的结果突显了当前AI模型的潜力和局限性。虽然AI在各个领域取得了重大进展,但在处理复杂视觉和数学挑战方面仍有很大改进空间。这些结果强调了持续研究和开发的重要性,以弥合AI与人类问题解决能力之间的差距。
MathVista 是最新开发的基准测试,揭示了 AI 模型在解决视觉导向数学挑战方面的表现。虽然像 GPT-4V 这样的 AI 模型表现出了超越随机猜测的潜力,并在特定领域表现出色,但它们与人类水平相比仍有显著差距需要弥补。这项研究提醒我们,提升 AI 解决问题能力的探索仍在继续,其影响范围涵盖自动驾驶、医疗保健等诸多应用。随着 AI 的不断发展,MathVista 等基准测试将在评估和提升其解决复杂问题的能力方面发挥关键作用。
如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。
免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

John Palmer
John Murangiri 带着市场分析技能加入 Cryptopolitan。John(又名 JP)毕业于内罗毕大学,获得大众传播与媒体研究学士学位。他曾为 InsideBitcoins.com 和 Metacoingraph 贡献加密货币市场洞察。















