Анализ производительности ИИ в решении сложных задач с использованием бенчмарка MathVista

- Модели ИИ, включая GPT-4V, показали потенциал в решении сложных визуальных и математических задач, но всё ещё уступают человеческим возможностям.
- MathVista — новый бенчмарк, оценивающий способность ИИ справляться с визуально ориентированными математическими задачами, подчёркивая необходимость дальнейших исследований и разработок.
- Навыки решения визуальных задач в ИИ имеют решающее значение для таких приложений, как автономные транспортные средства, и имеют последствия во многих областях.
Искусственный интеллект (ИИ) за последние годы достиг значительных успехов, успешно справляясь с задачами, связанными с текстом и изображениями. Однако его способность решать сложные проблемы, особенно те, которые требуют математических рассуждений и учета визуального контекста, вызывает вопросы о его надежности. Хотя утверждалось, что такие модели ИИ, как GPT-4, отлично справляются с задачами вроде экзаменов SAT по математике, не все эти заявления выдержали проверку на достоверность.
Недавняя статья даже отозвала свое утверждение о том, что GPT-4 может получить степень по компьютерным наукам в Массачусетском технологическом институте (MIT). Чтобы глубже понять, как модели ИИ справляются с решением задач, команда исследователей из Калифорнийского университета в Лос-Анджелесе, Вашингтонского университета и Microsoft Research разработала новый тестовый бенчмарк под названием MathVista. Этот бенчмарк ориентирован на визуально-ориентированные задачи для оценки возможностей больших языковых моделей (LLM) и больших мультимодальных моделей (LMM).
Представляем MathVista: бенчмарк для решения визуальных задач
Исследователи осознали необходимость систематического изучения способности фундаментальных моделей выполнять математические рассуждения в визуальном контексте. Для этого они представили MathVista — тестовый бенчмарк, включающий 6141 пример, взятых из 28 мультимодальных наборов данных и трех новых наборов данных: IQTest, FunctionQA и PaperQA. MathVista охватывает различные формы рассуждений, включая алгебраические, арифметические, геометрические, логические, числовые, научные и статистические. Он фокусируется на таких задачах, как ответы на вопросы по рисункам, решение геометрических задач, текстовые математические задачи, вопросы из учебников и визуальные вопросы. Разработка MathVista была необходима для содействия развитию математических рассуждений с визуальным компонентом и оценки того, как различные модели ИИ справляются с задачами на рассуждение.
Важность решения визуальных задач для ИИ
Навыки решения визуальных задач в ИИ имеют первостепенное значение, особенно в таких приложениях, как автономные транспортные средства. Демонстрация способности модели ИИ правильно решать визуальные задачи критически важна для обеспечения доверия и безопасности в различных областях.
Модели ИИ, протестированные в MathVista
Исследовательская команда оценила дюжину фундаментальных моделей, включая три большие языковые модели (LLM): ChatGPT, GPT-4 и Claude-2, две проприетарные большие мультимодальные модели (LMM): GPT4V и Bard, а также семь моделей LMM с открытым исходным кодом. Помимо моделей ИИ, они рассмотрели ответы людей, предоставленные лицами с как минимум средним образованием через платформу Amazon Mechanical Turk, а также случайные ответы.
Модели ИИ превосходят случайный выбор
Исследование дало некоторые обнадеживающие результаты для специалистов в области ИИ. Все протестированные LLM и LMM показали результаты лучше, чем случайный выбор, что неудивительно, учитывая, что многие вопросы в MathVista были с множественным выбором, а не с ответами «да» или «нет». GPT-4V от OpenAI оказался лучшим, превзойдя человеческие показатели в определенных областях, особенно в вопросах, связанных с алгебраическими рассуждениями и сложными визуальными задачами, такими как те, что касаются таблиц и графиков функций.
GPT-4V уступает человеческой производительности
Несмотря на впечатляющие результаты GPT-4V, она все же уступила человеческим участникам, прошедшим то же тестирование. В то время как модель ИИ достигла точности 49,9 процента, человеческие участники показали результат 60,3 процента. Эта разница в 10,4 процента по общей точности подчеркивает необходимость дальнейших улучшений способности моделей ИИ справляться со сложными визуальными и математическими задачами на рассуждение.
Последствия для развития ИИ
Результаты бенчмарка MathVista подчеркивают потенциал и ограничения текущих моделей ИИ. Хотя ИИ достиг значительного прогресса в различных областях, все еще есть много возможностей для улучшения в плане обработки сложных визуальных и математических задач. Эти результаты подчеркивают важность продолжения исследований и разработок для сокращения разрыва между способностями ИИ и человека к решению проблем.
Недавно разработанный бенчмарк MathVista проливает свет на производительность моделей ИИ в решении математических задач, ориентированных на визуальную составляющую. Хотя такие модели ИИ, как GPT-4V, показали свои перспективы, превзойдя случайный выбор и преуспев в определенных областях, им все еще предстоит преодолеть значительный разрыв, чтобы достичь уровня человеческого мастерства. Это исследование служит напоминанием о непрерывном стремлении улучшить способности ИИ к решению проблем, что имеет последствия для приложений, ranging от автономных транспортных средств до здравоохранения и не только. По мере эволюции ИИ такие бенчмарки, как MathVista, будут играть ключевую роль в оценке и развитии его возможностей в решении сложных задач.
Если вы читаете это, вы уже впереди. Оставайтесь с нами, подписавшись на нашу рассылку.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Джон Палмер
Джон Мурангири пришел в Cryptopolitan, обладая навыками анализа рынка. Джон (также известный как JP) окончил Найробийский университет по специальности «Массовая коммуникация и медиаисследования». Ранее он публиковал аналитические материалы о криптовалютном рынке на InsideBitcoins.com и Metacoingraph.















