تقييم أداء الذكاء الاصطناعي في حل المشكلات الصعبة باستخدام معيار MathVista

- أظهرت نماذج الذكاء الاصطناعي، بما في ذلك GPT-4V، وعودًا في حل المشكلات البصرية والرياضية المعقدة، لكنها لا تزال دون مستوى الأداء البشري.
- يُقيّم معيار MathVista الجديد قدرة الذكاء الاصطناعي على مواجهة التحديات الرياضية ذات الطابع البصري، مؤكدًا الحاجة إلى مزيد من البحث والتطوير.
- تُعد مهارات حل المشكلات البصرية في الذكاء الاصطناعي أمرًا حاسمًا لتطبيقات مثل المركبات ذاتية القيادة، ولها آثار عبر مجالات متنوعة.
حققت الذكاء الاصطناعي (AI) خطوات كبيرة في السنوات الأخيرة، حيث نجح في التعامل مع المهام المتعلقة بالنصوص والصور. ومع ذلك، أثارت أدائه في حل المشكلات المعقدة، خاصة تلك التي تتضمن الاستدلال الرياضي والسياق البصري، تساؤلات حول موثوقيته. بينما تم الادعاء بأن نماذج الذكاء الاصطناعي مثل GPT-4 تتفوق في مهام مثل امتحانات الرياضيات في اختبار SAT، لم تثبت جميع هذه الادعاءات صحتها تحت المجهر.
حتى أن ورقة بحثية حديثة سحبت ادعاءها بأن GPT-4 يمكنه الحصول على درجة في علوم الحاسوب من معهد ماساتشوستس للتكنولوجيا (MIT). ولتعميق فهم كيفية تعامل نماذج الذكاء الاصطناعي مع حل المشكلات، طور فريق من الباحثين من جامعة كاليفورنيا، لوس أنجلوس، وجامعة واشنطن، ومختبرات Microsoft Research معيار اختبار جديد يُسمى MathVista. يركز هذا المعيار على التحديات الموجهة بصرياً لتقييم قدرات كل من نماذج اللغات الكبيرة (LLMs) والنماذج متعددة الوسائط الكبيرة (LMMs).
مقدمة إلى MathVista: معيار لحل المشكلات البصرية
أدرك الباحثون الحاجة إلى فحص قدرة النماذج الأساسية على إجراء الاستدلال الرياضي في السياقات البصرية بشكل منهجي. وللتعامل مع هذا الأمر، قدموا MathVista، وهو معيار اختباري يتضمن 6141 مثالاً مستمدة من 28 مجموعة بيانات متعددة الوسائط وثلاث مجموعات بيانات جديدة تسمى IQTest وFunctionQA وPaperQA. يغطي MathVista أشكالاً مختلفة من الاستدلال، بما في ذلك الجبري والحسابي والهندسي والمنطقي والرقمي والعلمي والإحصائي. ويركز على مهام مثل الإجابة على أسئلة الأشكال، وحل المشكلات الهندسية، ومشكلات الرياضيات اللفظية، وأسئلة الكتب المدرسية، والأسئلة البصرية. كان تطوير MathVista ضرورياً لتسهيل تقدم الاستدلال الرياضي المكون من عنصر بصري وتقييم كيفية أداء نماذج الذكاء الاصطناعي المختلفة في مهام الاستدلال.
أهمية حل المشكلات البصرية للذكاء الاصطناعي
تتمتع مهارات حل المشكلات البصرية في الذكاء الاصطناعي بأهمية قصوى، خاصة في التطبيقات مثل المركبات ذاتية القيادة. إن إثبات قدرة نموذج الذكاء الاصطناعي على حل المشكلات البصرية بشكل صحيح أمر حاسم لضمان الثقة والسلامة في مختلف المجالات.
نماذج الذكاء الاصطناعي التي تم اختبارها في MathVista
قام فريق البحث بتقييم عشرة نماذج أساسية، بما في ذلك ثلاثة نماذج لغوية كبيرة (LLMs): ChatGPT وGPT-4 وClaude-2، ونموذجين كبيرين متعددي الوسائط مملوكين (LMMs): GPT4V وBard، وسبعة نماذج LMMs مفتوحة المصدر. بالإضافة إلى نماذج الذكاء الاصطناعي، أخذوا في الاعتبار الإجابات البشرية المقدمة من أفراد يحملون على الأقل شهادة الثانوية العامة من خلال Amazon Mechanical Turk، بالإضافة إلى الاستجابات العشوائية.
نماذج الذكاء الاصطناعي تتفوق على التخمين العشوائي
أظهرت الدراسة بعض النتائج المشجعة لممارسي الذكاء الاصطناعي. فقد أدى جميع نماذج LLMs وLMMs التي تم اختبارها بشكل أفضل من التخمين العشوائي، وهو أمر ليس مفاجئاً نظراً لأن العديد من أسئلة MathVista كانت من نوع الاختيار من متعدد بدلاً من الأسئلة بنعم أو لا. برز GPT-4V الخاص بـ OpenAI كأفضل أداء، متفوقاً على الأداء البشري في مجالات محددة، لا سيما في الأسئلة المتعلقة بالاستدلال الجبري والتحديات البصرية المعقدة، مثل تلك المتعلقة بالجداول ورسوم المخططات الوظيفية.
GPT-4V لم يصل إلى مستوى الأداء البشري
على الرغم من الأداء المثير للإعجاب لـ GPT-4V، إلا أنه لا يزال دون مستوى المشاركين البشر الذين خضعوا لنفس الاختبار. بينما حقق نموذج الذكاء الاصطناعي معدل دقة بنسبة 49.9 في المئة، حقق المشاركون البشر درجة 60.3 في المئة. يسلط هذا الفارق البالغ 10.4 في المئة في الدقة الإجمالية الضوء على الحاجة إلى مزيد من التحسينات في قدرة نماذج الذكاء الاصطناعي على التعامل مع مهام الاستدلال البصري والرياضي المعقدة.
آثار على تطوير الذكاء الاصطناعي
تسلط النتائج المستخلصة من معيار MathVista الضوء على إمكانات ونماذج الذكاء الاصطناعي الحالية وحدودها. على الرغم من أن الذكاء الاصطناعي أحرز تقدماً كبيراً في مختلف المجالات، لا يزال هناك مجال واسع للتحسين من حيث التعامل مع التحديات البصرية والرياضية المعقدة. تؤكد هذه النتائج على أهمية استمرار البحث والتطوير لسد الفجوة بين قدرات الذكاء الاصطناعي وقدرات حل المشكلات البشرية.
يُضيء معيار MathVista، الذي تم تطويره حديثاً، على أداء نماذج الذكاء الاصطناعي في حل التحديات الرياضية الموجهة بصرياً. على الرغم من أن نماذج الذكاء الاصطناعي مثل GPT-4V أظهرت وعداً من خلال تفوقها على التخمين العشوائي وتفوقها في مجالات محددة، إلا أنها لا تزال بحاجة إلى سد فجوة كبيرة لمواكبة الأداء البشري. تعمل هذه الأبحاث كذكرى بالبحث المستمر لتعزيز قدرات الذكاء الاصطناعي في حل المشكلات، مع آثار تمتد إلى تطبيقات تتراوح من المركبات ذاتية القيادة إلى الرعاية الصحية وما وراء ذلك. ومع استمرار تطور الذكاء الاصطناعي، ستلعب معايير مثل MathVista دوراً حاسماً في تقييم قدراته وتطويرها في حل المشكلات المعقدة.
إذا كنت تقرأ هذا، فأنت متقدّم بالفعل. ابق هناك مع نشرتنا الإخبارية.
إخلاء مسؤولية. المعلومات المقدمة ليست نصيحة تداول. Cryptopolitan.com لا تتحمل أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المقدمة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو الاستعانة بمستشار مؤهل قبل اتخاذ أي قرارات استثمارية.

جون بالمر
انضم جون مورانغيري إلى موقع Cryptopolitan ممتلئاً بمهارات تحليل السوق. تخرج جون (المعروف أيضاً باسم جيه بي) من جامعة نيروبي بحصوله على درجة البكالوريوس في الاتصالات الجماهيرية ودراسات الإعلام. وساهم سابقاً بتحليلات لسوق العملات المشفرة في موقعي InsideBitcoins.com و Metacoingraph.















