نشرت OpenAI وIronclad في 6 أكتوبر 2026 نتائج تقييم بحثي لوكلاء الذكاء الاصطناعي الذين يتعاملون مع مسارات العمل التعاقدية في برامج الشركات. وفي 11 مهمة، حقق GPT‑6 Astra متوسط درجة بلغ 55,0% وفق معايير الإنجاز، بينما سجل GPT‑5.6 Sol نسبة 41,6%.

شملت المهام أعمالًا قانونية وتجارية وأعمال مشتريات، مثل إعداد اتفاقية عدم إفصاح، وإنشاء مسارات موافقة على المشتريات، وتعديل بند قانوني نموذجي بما يتناسب مع الولاية القضائية المختارة. وتصف OpenAI هدف البحث بأنه اختبار قدرة الوكيل على إتمام عملية متعددة المراحل مع الحفاظ على قواعد العمل والتحقق من النتيجة بمقارنتها بالمتطلبات الأصلية.
كيفية قياس الإنجاز
ساعد موظفو Ironclad وأشخاص يستخدمون Ironclad في OpenAI على تحديد 11 مهمة. وقُيّمت كل مهمة وفق 8 إلى 50 معيارًا، بحسب مستوى صعوبتها. وقدمت Ironclad بيئات مستضافة لبرامجها لتدريب النماذج، وتقول OpenAI إنها حسّنت النماذج باستخدام مهام اصطناعية والتعلّم المعزز.
استخدمت المقارنة إعدادات حقق فيها كل نموذج أعلى درجاته: Max reasoning لـAstra وHigh reasoning لـSol. ووفقًا للجدول الذي نشرته OpenAI، بلغ متوسط الزمن التقديري للمحاولة 19,2 دقيقة لـAstra و37,0 دقيقة لـSol. وهذه تقديرات محاكاة تستند إلى السرعة المفترضة للمعالجة والتوليد، وليست قياسًا للوقت الذي وفره العملاء.
ما الذي تكشفه النتائج؟
يوضح التقييم كيف يمكن اختبار وكيل حاسوبي استنادًا إلى الحالة النهائية لمسار عمل معقد: إذ تتيح مجموعة المعايير معرفة المتطلبات التي نفذها النظام وتلك التي أغفلها. وبالنسبة إلى الشركات التي تقيّم أدوات مماثلة، يتمثل المؤشر العملي في فحص ما هو أبعد من الإجراءات المنفردة في الواجهة، والنظر أيضًا في كيفية تعامل مسار العمل المُعدّ مع الظروف المختلفة، مثل عتبات الموافقة والاستثناءات.
تقتصر الأرقام على 11 مهمة بحثية، ولا تصف جميع مسارات العمل في Ironclad. وفي مثال منفصل من المنشور، أنجز Astra نحو 94% من المعايير خلال 20 دقيقة تقديريًا، بينما أنجز Sol نحو 85% خلال 32 دقيقة؛ وهذا مثال على مهمة واحدة، وليس متوسطًا للأداء. وتشير OpenAI أيضًا إلى أنها أنشأت المهام الاصطناعية استنادًا إلى عقود عامة من قاعدة بيانات SEC EDGAR بعد تصفية البيانات الشخصية؛ ووفقًا للشركة، لم تُستخدم عقود العملاء غير المنشورة في التدريب أو التقييم.
وشددت سونيتا فارما، المديرة التقنية في Ironclad، على أهمية مسار العمل المتكامل. وفي ترجمة الاقتباس الوارد في منشور OpenAI: «يحتاج الوكلاء إلى فهم دورة حياة العقد كاملة، بما في ذلك ترابط مسارات العمل، مع الحفاظ على مستوى التحكم الذي تعتمد عليه الفرق».
وتصف OpenAI التعاون بأنه عمل بحثي لتدريب النماذج وتقييمها. وتقدم الدرجات المنشورة لمحة عن النتائج في المهام المختارة؛ لكن المنشور لا يتضمن تحققًا مستقلًا من التقييم أو قياسات للأداء على مجموعة أوسع من مسارات عمل العملاء.
ترجمة الاقتباس: «يحتاج الوكلاء إلى فهم دورة حياة العقد كاملة، بما في ذلك ترابط مسارات العمل، مع الحفاظ على مستوى التحكم الذي تعتمد عليه الفرق».