تعزيز وكيل OpenAI Operator بنموذج ذكاء اصطناعي جديد

- قامت OpenAI بترقية المشغل، وهو وكيل ذكاء اصطناعي يستخدم الويب لأداء المهام، إلى نموذج يعتمد على o3 بعد استخدام نسخة مخصصة سابقاً من GPT-4o.
- تم ضبط عامل o3 Operator بدقة باستخدام بيانات سلامة إضافية للاستخدام الحاسوبي، بما في ذلك مجموعات بيانات مصممة لتعليم النموذج حدود القرار.
- مايك نوب، أحد المؤسسين المشاركين لمؤسسة Arc Prize، يعتقد أن تشغيل نموذج o3 قد يكون أكثر تكلفة مما هو متوقع.
قامت OpenAI بتحديث نموذج الذكاء الاصطناعي الذي يعمل على تشغيل Operator من الإصدار المخصص السابق من GPT-4o إلى نموذج قائم على o3، وهو أحد أحدث نماذج "التفكير" في سلسلة o من OpenAI. تم ضبط Operator القائم على o3 بدقة مع بيانات سلامة إضافية لاستخدام الكمبيوتر وشمل مجموعات بيانات سلامة مصممة لتعليم حدود قرار النموذج.
تضع OpenAI رفعت المشغل في ChatGPT بنموذج وكيل استخدام الكمبيوتر (CUA) الجديد المستند إلى نسخة من OpenAI o3. مع النموذج الجديد، أصبح المشغل أكثر ثباتاً ودقة عند التفاعل مع المتصفح، مما أدى إلى تحسين معدل نجاح المهام بشكل عام. كما يقدم استجابات ذات بنية أفضل وأكثر وضوحاً وشمولية.
وفقاً لـ تضع OpenAI, أظهر نموذج CUA الجديد أداءً أقوى مقارنة بالصناعة، محققاً حالة السبق التقني (SOTA) على OSWorld وWebArena. كما أظهر أداءً نسبياً أقوى مقارنة بالإصدار السابق، سواء في الاختبارات المعيارية الثابتة أو تقييمات تفضيلات البشر.
تستبدل OpenAI النموذج المعتمد على GPT-4o بنسخة تعتمد على o3
OpenAI تلمح إلى ترقية كبيرة لـ ChatGPT Operator Agent pic.twitter.com/iGPQp9butD
— SabatAge (@sabatage) مايو 22، 2025
استبدلت OpenAI النموذج الحالي المعتمد على GPT-4o للمشغل بنسخة تعتمد على OpenAI o3، على الرغم من أن إصدار واجهة برمجة التطبيقات (API) سيظل يعتمد على 4o. كما زعمت شركة الذكاء الاصطناعي أن مشغل o3 يستخدم نفس النهج متعدد الطبقات للأمان المستخدم في نسخة 4o.
ومع ذلك، مقارنةً بالنماذج الأخرى في عائلة o3، تم ضبط مشغل o3 بدقة باستخدام بيانات أمان إضافية لاستخدام الكمبيوتر، بما في ذلك مجموعات بيانات مصممة لتعليم حدود القرار الخاصة بالنموذج بشأن التأكيدات والرفض.
تضع OpenAI أصدر تقريراً تقنياً يظهر أداء مشغل o3 في تقييمات الأمان المحددة. مقارنةً بنموذج مشغل GPT-4o، كان مشغل o3 أقل عرضة لرفض تنفيذ أنشطة "غير مشروعة" والبحث عن بيانات شخصية حساسة، وأقل عرضة لنوع من هجمات الذكاء الاصطناعي المعروف باسم "حقن المطالبة" (prompt injection).
"يستخدم مشغل o3 نفس النهج متعدد الطبقات للأمان الذي استخدمناه لنسخة 4o من المشغل... على الرغم من أن مشغل o3 يرث قدرات البرمجة الخاصة بـ o3، إلا أنه لا يتمتع بإمكانية الوصول الأصلية إلى بيئة برمجة أو طرفية (Terminal)."
كما كشفت الشركة عن أن النموذج الجديد القائم على o3 خضع لتقييمات السلامة القياسية، وظل Operator متاحاً كإصدار بحثي لمستخدمي ChatGPT Pro حول العالم. ومع ذلك، كان هذا النموذج المطور متاحاً فقط في Operator في ChatGPT.
كnoop يشتبه في أن تشغيل نموذج o3 من OpenAI قد يكون أكثر تكلفة مما هو متوقع
في الأسبوع الماضي، قامت مؤسسة جائزة Arc (Arc Prize Foundation)، التي تحافظ على ARC-AGI وتديرها، بتحديث تكاليف الحوسبة التقريبية لنموذج o3. كانت المؤسسة قد قدرت في الأصل أن التكوين الأفضل أداءً من o3 الذي اختبرته، وهو o3 high، يكلف حوالي 3000 دولار لحل مشكلة ARC-AGI واحدة. ومع ذلك، تعتقد المؤسسة الآن أن التكلفة قد تكون أعلى بـ 10 مرات من التقدير السابق، وربما تصل إلى حوالي 30000 دولار لكل مهمة.
أيضاً، بينما لم تحدد OpenAI بعد سعر o3 أو تطلقه بالكامل، يعتقد مايك كnoop، أحد المؤسسين المشتركين لمؤسسة جائزة Arc، أن تسعير نموذج o1-pro يمثل مقياساً معقولاً ومقارنة أقرب للتكلفة الحقيقية لـ o3. ومع ذلك، أضاف أن o3 سيستمر في تصنيفه كإصدار تجريبي على لوحة المتصدرين لتعكس عدم اليقين حتى يتم الإعلان عن التسعير الرسمي.
وفقاً لمؤسسة جائزة Arc، فإن السعر المرتفع لـ o3 high ليس مستبعداً، نظراً لكمية موارد الحوسبة التي يستخدمها النموذج reportedly. استخدم o3 high أكثر بـ 172 مرة من موارد الحوسبة مقارنة بـ o3 low، وهو التكوين الأقل استخداماً للحوسبة في o3، للتعامل مع ARC-AGI.
دأبت الشائعات على الانتشار منذ أوائل مارس حول الخطط باهظة الثمن التي كانت OpenAI تدرس طرحها لعملاء المؤسسات. أفادت المعلومات بأن الشركة قد تفرض ما يصل إلى 20000 دولار شهرياً على وكلاء الذكاء الاصطناعي المتخصصين، مثل وكلاء تطوير البرمجيات.
ومع ذلك، بينما جادل البعض بأن حتى أغلى نماذج OpenAI ستكلف أقل بكثير مما يطلبه المتعاقد البشري النموذجي أو الموظف، أشار باحث الذكاء الاصطناعي توبي أورد إلى أن النماذج قد لا تكون فعالة بنفس القدر. على سبيل المثال، احتاج o3 high إلى 1024 محاولة لكل مهمة في ARC-AGI لتحقيق أفضل نتيجة.
لا تكتفِ بقراءة أخبار العملات الرقمية فحسب، بل افهمها. اشترك في نشرتنا الإخبارية. مجانية.

كولينز ج. أوكونو
كولينس أوكوث صحفي ومحلل أسواق بخبرة تمتد لـ8 سنوات في تغطية العملات الرقمية والتكنولوجيا. وهو محلل مالي معتمد (CFA) وحاصل على درجة علمية في الرياضيات الاكتوارية. عمل كولينس سابقًا مع شركة جيكمبيوتر وشركة كوينرابيت بصفتيه كاتبًا ومحررًا.















