El rendimiento de la IA en la resolución de problemas difíciles examinado con el benchmark MathVista

- Los modelos de IA, incluidos GPT-4V, han mostrado potencial para resolver problemas visuales y matemáticos complejos, pero aún no alcanzan el rendimiento humano.
- MathVista, una nueva métrica, evalúa la capacidad de la IA para abordar desafíos matemáticos orientados a lo visual, destacando la necesidad de más investigación y desarrollo.
- Las habilidades de resolución de problemas visuales en la IA son cruciales para aplicaciones como los vehículos autónomos y tienen implicaciones en diversos sectores.
La inteligencia artificial (IA) ha dado pasos significativos en los últimos años, manejando con éxito tareas que involucran texto e imágenes. Sin embargo, su rendimiento en la resolución de problemas complejos, especialmente aquellos que implican razonamiento matemático y contexto visual, ha planteado dudas sobre su fiabilidad. Aunque se han hecho afirmaciones sobre modelos de IA como GPT-4 destacando en tareas como los exámenes de matemáticas del SAT, no todas estas afirmaciones han resistido el escrutinio.
Un artículo reciente incluso retractó su afirmación de que GPT-4 podría obtener un grado en ciencias de la computación en el MIT. Para comprender mejor cómo los modelos de IA manejan la resolución de problemas, un equipo de investigadores de la Universidad de California, Los Ángeles, la Universidad de Washington y Microsoft Research ha desarrollado un nuevo benchmark de prueba llamado MathVista. Este benchmark se centra en desafíos orientados a lo visual para evaluar las capacidades tanto de los modelos de lenguaje grandes (LLM) como de los modelos multimodales grandes (LMM).
Presentando MathVista: Un benchmark para la resolución visual de problemas
Los investigadores reconocieron la necesidad de examinar sistemáticamente la capacidad de los modelos fundamentales para realizar razonamiento matemático en contextos visuales. Para abordar esto, introdujeron MathVista, un benchmark de prueba que incluye 6.141 ejemplos extraídos de 28 conjuntos de datos multimodales y tres nuevos conjuntos de datos llamados IQTest, FunctionQA y PaperQA. MathVista abarca varias formas de razonamiento, incluyendo algebraico, aritmético, geométrico, lógico, numérico, científico y estadístico. Se centra en tareas como preguntas sobre figuras, resolución de problemas geométricos, problemas matemáticos de palabras, preguntas de libros de texto y preguntas visuales. Desarrollar MathVista fue esencial para facilitar el avance del razonamiento matemático con un componente visual y evaluar cómo se desempeñan diferentes modelos de IA en tareas de razonamiento.
La importancia de la resolución visual de problemas para la IA
Las habilidades de resolución visual de problemas en la IA son de suma importancia, especialmente en aplicaciones como los vehículos autónomos. Demostrar la capacidad de un modelo de IA para resolver correctamente problemas visuales es crítico para garantizar la confianza y la seguridad en varios dominios.
Modelos de IA probados en MathVista
El equipo de investigación evaluó una docena de modelos fundamentales, incluidos tres grandes modelos de lenguaje (LLM): ChatGPT, GPT-4 y Claude-2, dos grandes modelos multimodales (LMM) propietarios: GPT4V y Bard, y siete LMM de código abierto. Además de los modelos de IA, consideraron las respuestas humanas proporcionadas por individuos con al menos un título de escuela secundaria a través de Amazon Mechanical Turk, así como respuestas aleatorias.
Los modelos de IA superan al azar
El estudio arrojó algunos resultados alentadores para los profesionales de la IA. Todos los LLM y LMM probados se desempeñaron mejor que el azar, lo cual no es sorprendente dado que muchas de las preguntas en MathVista eran de opción múltiple en lugar de preguntas de sí o no. GPT-4V de OpenAI surgió como el mejor performer, superando el rendimiento humano en áreas específicas, particularmente en preguntas que involucran razonamiento algebraico y desafíos visuales complejos, como aquellos relacionados con tablas y gráficos de funciones.
GPT-4V se queda corta del rendimiento humano
A pesar del impresionante rendimiento de GPT-4V, aún se quedó corta frente a los participantes humanos que realizaron la misma prueba. Mientras que el modelo de IA logró una tasa de precisión del 49,9 %, los participantes humanos obtuvieron una puntuación del 60,3 %. Esta brecha del 10,4 % en la precisión general destaca la necesidad de mejoras adicionales en la capacidad de los modelos de IA para manejar tareas complejas de razonamiento visual y matemático.
Implicaciones para el desarrollo de la IA
Los hallazgos del benchmark MathVista subrayan el potencial y las limitaciones de los modelos de IA actuales. Si bien la IA ha progresado significativamente en varios dominios, aún hay mucho margen de mejora en términos de manejo de desafíos visuales y matemáticos complejos. Estos resultados enfatizan la importancia de la investigación y el desarrollo continuos para cerrar la brecha entre las capacidades de resolución de problemas de la IA y las humanas.
MathVista, el benchmark recién desarrollado, arroja luz sobre el rendimiento de los modelos de IA en la resolución de desafíos matemáticos orientados a lo visual. Si bien modelos de IA como GPT-4V han mostrado promesa al superar el azar y destacar en áreas específicas, aún tienen una brecha significativa que cerrar para igualar el rendimiento a nivel humano. Esta investigación sirve como recordatorio de la búsqueda continua para mejorar las habilidades de resolución de problemas de la IA, con implicaciones para aplicaciones que van desde vehículos autónomos hasta atención médica y más allá. A medida que la IA continúa evolucionando, benchmarks como MathVista jugarán un papel crucial en evaluar y avanzar sus capacidades en la resolución de problemas complejos.
Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

John Palmer
John Murangiri llegó a Cryptopolitan con habilidades en análisis de mercado. John (también conocido como JP) se graduó de la Universidad de Nairobi con un título de licenciatura en comunicación masiva y estudios de medios. Anteriormente, ha contribuido con perspectivas del mercado de criptomonedas a InsideBitcoins.com y Metacoingraph.















