MathVista ベンチマークを用いた難問解決における AI の性能を検証

- GPT-4V を含む AI モデルは、複雑な視覚的・数学的問題の解決において有望な成果を示していますが、依然として人間の性能には及びません。
- MathVista は、AI が視覚に依存する数学的課題に取り組む能力を評価する新たなベンチマークであり、さらなる研究開発の必要性を強調しています。
- AI の視覚的問題解決能力は、自動運転車などの応用において不可欠であり、さまざまな分野に影響を及ぼします。
人工知能(AI)は近年大きな進歩を遂げ、テキストや画像に関連するタスクを成功裡に処理できるようになりました。しかし、特に数学的推論と視覚的文脈を伴う複雑な問題解決におけるその性能は、信頼性に関する疑問を投げかけています。GPT-4 などの AI モデルが SAT 数学試験のようなタスクで卓越しているという主張もなされていますが、これらの主張のすべてが厳密な検証に耐えられたわけではありません。
最新の論文では、GPT-4がMITのコンピュータサイエンス学位を取得できるという主張さえ撤回されました。AIモデルが問題解決をどのように処理するかをより深く理解するため、カリフォルニア大学ロサンゼルス校、ワシントン大学、マイクロソフトリサーチの研究者チームは、MathVistaと呼ばれる新しいテストベンチマークを開発しました。このベンチマークは、大規模言語モデル(LLM)と大規模多モーダルモデル(LMM)の能力を評価するために、視覚に焦点を当てた課題を対象としています。
MathVistaの紹介:視覚的問題解決のためのベンチマーク
研究者たちは、ファウンデーションモデルが視覚的文脈で数学的推論を行う能力を体系的に検証する必要性を認識しました。これに対応するため、28 のマルチモーダルデータセットと IQTest、FunctionQA、PaperQA という 3 つの新しいデータセットから抽出された 6,141 の例題を含むテストベンチマーク「MathVista」を導入しました。MathVista は、代数的、算術的、幾何学的、論理的、数値的、科学的、統計的な推論など、さまざまな形式の推論を網羅しています。また、図表の質問応答、幾何学問題の解決、文章題、教科書の質問、視覚的問題といったタスクに焦点を当てています。MathVista の開発は、視覚要素を組み込んだ数学的推論の進展を促進し、異なる AI モデルが推論タスクでどのようにパフォーマンスを発揮するかを評価するために不可欠でした。
AI における視覚的問題解決の重要性
AI の視覚的問題解決能力は極めて重要であり、特に自動運転車などのアプリケーションにおいてその重要性は計り知れません。AI モデルが視覚的問題を正しく解決できることを実証することは、さまざまな分野における信頼性と安全性を確保する上で決定的に重要です。
MathVista でテストされた AI モデル
研究チームは、ChatGPT、GPT-4、Claude-2 の 3 つの大型言語モデル (LLM) を含む 12 の基盤モデルを評価しました。これには、GPT4V と Bard の 2 つの独自大規模多モーダルモデル (LMM)、および 7 つのオープンソース LMM が含まれます。AI モデルに加え、Amazon Mechanical Turk で募集した高校卒業以上の学歴を持つ個人による人間の回答や、ランダムな回答も検討対象としました。
AI モデルは偶然の確率を上回る性能を示す
この研究は、AI 実務家にとっていくつかの励みとなる結果をもたらしました。テストされたすべての LLM と LMM は、偶然の確率よりも高いパフォーマンスを発揮しました。これは、MathVista の質問の多くが yes/no 形式ではなく選択式だったため、驚くべきことではありません。OpenAI の GPT-4V は最上位のパフォーマンスを示し、特に代数推論や表や関数プロットに関連する複雑な視覚的課題など、特定の分野において人間の性能を上回りました。
GPT-4V は人間の性能に達していない
GPT-4V の驚異的なパフォーマンスにもかかわらず、同じテストを受けた人間参加者には及びませんでした。AI モデルの精度は 49.9% でしたが、人間参加者のスコアは 60.3% でした。この全体精度における 10.4% の差は、AI モデルが複雑な視覚的・数学的推論タスクを処理する能力においてさらなる改善が必要であることを浮き彫りにしています。
AI 開発への示唆
MathVista ベンチマークからの知見は、現在の AI モデルの可能性と限界を強調しています。AI はさまざまな分野で大きな進歩を遂げていますが、複雑な視覚的・数学的課題に対処する点では依然として改善の余地が十分にあります。これらの結果は、AI と人間の問題解決能力との格差を埋めるために、継続的な研究開発が重要であることを示しています。
MathVista は、視覚に依存する数学的課題の解決における AI モデルのパフォーマンスを明らかにするために新たに開発されたベンチマークです。GPT-4V などの AI モデルは、単なる偶然を超え特定の分野で優れた成果を示す可能性を秘めていますが、人間レベルの性能に達するにはまだ大きなギャップがあります。本研究は、自律走行車から医療まで多岐にわたる応用分野に影響を与える、AI の問題解決能力を高めるための継続的な取り組みの重要性を再認識させるものです。AI が進化し続ける中で、MathVista のようなベンチマークは、複雑な問題解決における AI の能力を評価し、推進する上で重要な役割を果たします。
これをお読みいただいているあなたは、すでに一歩先を行っています。当社のニュースレターでその先を行ってください。
免責事項。 ここに提供される情報は取引助言ではありません。 Cryptopolitan.com 当社は、このページに提供される情報に基づいて行われたいかなる投資に対しても責任を負いません。いかなる投資判断を下す前に、独立した調査および/または資格を有する専門家への相談を強く推奨します。

ジョン・パーマー
John Murangiri氏は、市場分析のスキルを身につけてCryptopolitanに参加しました。John(通称JP)はナイロビ大学でマスコミュニケーションおよびメディア研究の学士号を取得し、これまでにInsideBitcoins.comやMetacoingraphで暗号資産市場の洞察を提供してきました。















