DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Performance de l'IA sur la résolution de problèmes difficiles examinée avec le benchmark MathVista

ParJohn PalmerJohn Palmer 3 min de lecture
MathVista
  • Les modèles d'IA, y compris GPT-4V, ont montré des promesses dans la résolution de problèmes visuels et mathématiques complexes, mais restent en deçà des performances humaines.
  • MathVista, un nouveau benchmark, évalue la capacité de l'IA à relever des défis mathématiques orientés vers le visuel, soulignant la nécessité de recherches et de développements supplémentaires.
  • Les compétences de résolution de problèmes visuels chez l'IA sont cruciales pour des applications comme les véhicules autonomes et ont des implications dans divers domaines.

Introduction de MathVista : Un benchmark pour la résolution de problèmes visuels

Un article récent a même retiré son affirmation selon laquelle GPT-4 pouvait obtenir un diplôme en informatique au MIT. Pour mieux comprendre comment les modèles d'IA gèrent la résolution de problèmes, une équipe de chercheurs de l'Université de Californie à Los Angeles, de l'Université de Washington et de Microsoft Research a développé un nouveau benchmark de test appelé MathVista. Ce benchmark se concentre sur les défis orientés visuellement pour évaluer les capacités des grands modèles de langage (LLM) et des grands modèles multimodaux (LMM).

Présentation de MathVista : Un benchmark pour la résolution visuelle de problèmes

Les chercheurs ont reconnu la nécessité d'examiner systématiquement la capacité des modèles fondamentaux à effectuer un raisonnement mathématique dans des contextes visuels. Pour y remédier, ils ont introduit MathVista, un benchmark de test qui comprend 6 141 exemples tirés de 28 ensembles de données multimodaux et de trois nouveaux ensembles de données nommés IQTest, FunctionQA et PaperQA. MathVista englobe diverses formes de raisonnement, y compris algébrique, arithmétique, géométrique, logique, numérique, scientifique et statistique. Il se concentre sur des tâches telles que la réponse aux questions sur les figures, la résolution de problèmes de géométrie, les problèmes de mots mathématiques, les questions de manuels scolaires et les questions visuelles. Le développement de MathVista était essentiel pour faciliter l'avancement du raisonnement mathématique avec une composante visuelle et évaluer la performance des différents modèles d'IA dans les tâches de raisonnement.

L'importance de la résolution de problèmes visuels pour l'IA

Les compétences de résolution de problèmes visuels en IA sont d'une importance primordiale, en particulier dans des applications comme les véhicules autonomes. Démontrer la capacité d'un modèle d'IA à résoudre correctement des problèmes visuels est critique pour garantir la confiance et la sécurité dans divers domaines.

Modèles d'IA testés dans MathVista

L'équipe de recherche a évalué une douzaine de modèles fondamentaux, y compris trois grands modèles de langage (LLM) : ChatGPT, GPT-4 et Claude-2, deux grands modèles multimodaux (LMM) propriétaires : GPT4V et Bard, et sept LMM open-source. En plus des modèles d'IA, ils ont pris en compte les réponses humaines fournies par des individus ayant au moins un diplôme d'études secondaires via Amazon Mechanical Turk, ainsi que des réponses aléatoires.

Les modèles d'IA surpassent le hasard

L'étude a donné des résultats encourageants pour les praticiens de l'IA. Tous les LLM et LMM testés ont performé mieux que le hasard, ce qui n'est pas surprenant étant donné que beaucoup de questions dans MathVista étaient à choix multiples plutôt que des questions oui/non. GPT-4V d'OpenAI s'est imposé comme le meilleur performer, surpassant la performance humaine dans des domaines spécifiques, en particulier dans les questions impliquant le raisonnement algébrique et des défis visuels complexes, tels que ceux liés aux tableaux et aux tracés de fonctions.

GPT-4V en dessous de la performance humaine

Malgré la performance impressionnante de GPT-4V, il est toujours resté en deçà des participants humains qui ont subi le même test. Alors que le modèle d'IA a atteint un taux de précision de 49,9 %, les participants humains ont obtenu un score de 60,3 %. Cet écart de 10,4 % en précision globale souligne la nécessité d'améliorations supplémentaires dans la capacité des modèles d'IA à gérer des tâches de raisonnement visuel et mathématique complexes.

Implications pour le développement de l’IA

Les résultats du benchmark MathVista soulignent le potentiel et les limites des modèles d'IA actuels. Bien que l'IA ait fait des progrès significatifs dans divers domaines, il reste encore beaucoup de place pour l'amélioration en ce qui concerne la gestion des défis visuels et mathématiques complexes. Ces résultats soulignent l'importance de la recherche et du développement continus pour combler l'écart entre les capacités de résolution de problèmes de l'IA et celles des humains.

MathVista, le benchmark nouvellement développé, éclaire la performance des modèles d'IA dans la résolution de défis mathématiques orientés visuellement. Bien que des modèles d'IA comme GPT-4V aient montré des promesses en surpassant le hasard et en excellant dans des domaines spécifiques, ils ont encore un écart significatif à combler pour atteindre la performance humaine. Cette recherche sert de rappel de la quête continue pour améliorer les capacités de résolution de problèmes de l'IA, avec des implications pour des applications allant des véhicules autonomes à la santé et au-delà. Alors que l'IA continue d'évoluer, des benchmarks comme MathVista joueront un rôle crucial dans l'évaluation et l'avancement de ses capacités dans la résolution de problèmes complexes.

Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

John Palmer

John Palmer

John Murangiri a rejoint Cryptopolitan avec des compétences en analyse de marché. John (alias JP) est diplômé de l'Université de Nairobi d'un baccalauréat en communication de masse et études médiatiques. Il a précédemment contribué à des analyses du marché crypto pour InsideBitcoins.com et Metacoingraph.

PLUS D'ACTUALITÉS…