MathVista 벤치마크를 통해 난제 해결에서의 AI 성능 분석

- GPT-4V를 포함한 AI 모델은 복잡한 시각적 및 수학 문제를 해결하는 데 잠재력을 보였으나, 여전히 인간의 성능에는 미치지 못하고 있습니다.
- 새로운 벤치마크인 MathVista는 시각 기반 수학 과제에 대한 AI의 능력을 평가하며, 추가 연구와 개발의 필요성을 강조합니다.
- 자율주행차 등 다양한 응용 분야에서 중요한 AI의 시각적 문제 해결 능력은 여러 도메인에 걸쳐 광범위한 영향을 미칩니다.
인공지능(AI)은 최근 몇 년间 텍스트 및 이미지 관련 작업을 성공적으로 처리하며 큰 진전을 이루었다. 그러나 수학적 추론과 시각적 맥락이 포함된 복잡한 문제를 해결하는 AI의 성능은 그 신뢰성에 의문을 제기한다. GPT-4와 같은 AI 모델이 SAT 수학 시험과 같은 작업에서 뛰어나다는 주장이 있었지만, 이러한 주장 중 일부는 검증 과정에서 부실했다.
최근 한 논문은 GPT-4가 MIT에서 컴퓨터 공학 학위를 받을 수 있다는 주장을 철회하기도 했다. AI 모델이 문제 해결을 어떻게 처리하는지 더 깊이 이해하기 위해, 캘리포니아 대학교 로스앤젤레스(UCLA), 워싱턴 대학교, 마이크로소프트 리서치 연구원들은 MathVista라는 새로운 테스트 벤치마크를 개발했다. 이 벤치마크는 대규모 언어 모델(LLM)과 대규모 다중 모달 모델(LMM)의 능력을 평가하기 위해 시각적 과제에 초점을 맞추고 있다.
MathVista 소개: 시각적 문제 해결을 위한 벤치마크
연구진은 파운데이션 모델이 시각적 맥락에서 수학적 추론을 수행하는 능력을 체계적으로 검토할 필요성을 인식했다. 이를 위해 연구진은 28개의 다중 모달 데이터셋과 IQTest, FunctionQA, PaperQA라는 세 가지 새로운 데이터셋에서 추출한 6,141개의 예제를 포함한 테스트 벤치마크인 MathVista를 소개했다. MathVista는 대수적, 산술적, 기하학적, 논리적, 수치적, 과학적, 통계적 추론 등 다양한 형태의 추론을 포괄한다. 또한 도형 질문 답변, 기하학 문제 해결, 수학 단어 문제, 교과서 질문, 시각적 질문과 같은 과제에 중점을 둔다. 시각적 요소가 포함된 수학적 추론의 발전을 촉진하고 다양한 AI 모델이 추론 작업에서 어떻게 수행되는지 평가하기 위해 MathVista를 개발하는 것이 필수적이었다.
AI를 위한 시각적 문제 해결의 중요성
AI의 시각적 문제 해결 능력은 자율 주행 차량과 같은 응용 분야에서 특히 중요하다. AI 모델이 시각적 문제를 올바르게 해결할 수 있음을 입증하는 것은 다양한 분야에서 신뢰와 안전을 보장하는 데 필수적이다.
MathVista에서 테스트된 AI 모델
연구팀은 ChatGPT, GPT-4, Claude-2라는 세 가지 대규모 언어 모델(LLM), GPT4V와 Bard라는 두 가지 독점 대규모 다중 모달 모델(LMM), 그리고 7개의 오픈 소스 LMM을 포함하여 dozen(12개)의 파운데이션 모델을 평가했다. AI 모델 외에도, 연구진은 아마존 Mechanical Turk를 통해 고등학교 이상의 학력을 가진 개인들이 제공한 인간 답변과 무작위 응답도 고려했다.
AI 모델은 무작위 추측보다 우수함
이 연구는 AI 실무자들에게 몇 가지 고무적인 결과를 가져왔다. 테스트된 모든 LLM과 LMM은 무작위 추측보다 더 나은 성능을 보였는데, 이는 MathVista의 많은 질문이 예/아니오 형식보다는 객관식이었다는 점을 고려하면 놀라운 일이 아니다. 오픈AI의 GPT-4V가 최상위 성능을 보였으며, 특히 대수적 추론과 표 및 함수 플롯과 관련된 복잡한 시각적 과제와 같은 특정 영역에서 인간 성능을 능가했다.
GPT-4V는 인간 성능에 미치지 못함
GPT-4V의 인상적인 성능에도 불구하고, 동일한 테스트를 받은 인간 참가자들에 비해 여전히 부족했다. AI 모델은 49.9%의 정확도를 달성한 반면, 인간 참가자는 60.3%의 점수를 기록했다. 전체 정확도에서 10.4%의 격차는 AI 모델이 복잡한 시각적 및 수학적 추론 작업을 처리하는 능력에 대한 추가 개선이 필요함을 강조한다.
AI 개발에 대한 함의
MathVista 벤치마크의 발견은 현재 AI 모델의 잠재력과 한계를 강조한다. AI는 다양한 분야에서 상당한 진전을 이루었지만, 복잡한 시각적 및 수학적 과제를 처리하는 측면에서는 여전히 개선의 여지가 많다. 이러한 결과는 AI와 인간의 문제 해결 능력 간의 격차를 해소하기 위해 지속적인 연구와 개발의 중요성을 강조한다.
새롭게 개발된 벤치마크인 MathVista는 시각적 지향적 수학 과제 해결에서 AI 모델의 성능을 조명한다. GPT-4V와 같은 AI 모델은 무작위 추측을 능가하고 특정 영역에서 뛰어나다는 가능성을 보였지만, 인간 수준의 성능에 도달하기 위해서는 여전히 상당한 격차를 메워야 한다. 이 연구는 자율 주행 차량부터 의료 분야에 이르기까지 다양한 응용 분야에 영향을 미치며, AI의 문제 해결 능력을 향상시키기 위한 지속적인 탐구의 중요성을 일깨워준다. AI가 계속 진화함에 따라 MathVista와 같은 벤치마크는 복잡한 문제 해결에서 AI의 능력을 평가하고 발전시키는 데 중요한 역할을 할 것이다.
가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.
면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.

존 팰머
John Murangiri는 시장 분석 기술을 갖춘 채 Cryptopolitan에 합류했습니다. John(별명 JP)은 나이로비 대학교에서 대중 매체 및 미디어 연구 학사 학위를 취득했으며, 이전에는 InsideBitcoins.com과 Metacoingraph에 암호화폐 시장 인사이트를 기여한 바 있습니다.















