jsonscraper

OpenAI وIronclad تقيّمان وكلاء الذكاء الاصطناعي في 11 مهمة تعاقدية

حقق GPT‑6 Astra متوسطًا قدره 55% وفق معايير OpenAI؛ وقدّرت الشركة زمن الإنجاز بالمحاكاة

نشرت OpenAI وIronclad في 6 أكتوبر 2026 نتائج تقييم بحثي لوكلاء الذكاء الاصطناعي الذين يتعاملون مع مسارات العمل التعاقدية في برامج الشركات. وفي 11 مهمة، حقق GPT‑6 Astra متوسط درجة بلغ 55,0% وفق معايير الإنجاز، بينما سجل GPT‑5.6 Sol نسبة 41,6%.

OpenAI وIronclad تقيّمان وكلاء الذكاء الاصطناعي في 11 مهمة تعاقدية
السياق: في تقييم نُشر في 6 أكتوبر، قارنت OpenAI بين GPT‑6 Astra وGPT‑5.6 Sol في 11 مهمة ضمن العمليات القانونية والتجارية وعمليات المشتريات في Ironclad. وتصف النتائج مجموعة بحثية، لا جميع مسارات العمل على المنصة.
الموضوع المرئي: إدارة العقود، سير العمل القانوني، مكتب، مستندات، حاسوب، Unsplash
OpenAI · صورة مولّدة بالذكاء الاصطناعي

شملت المهام أعمالًا قانونية وتجارية وأعمال مشتريات، مثل إعداد اتفاقية عدم إفصاح، وإنشاء مسارات موافقة على المشتريات، وتعديل بند قانوني نموذجي بما يتناسب مع الولاية القضائية المختارة. وتصف OpenAI هدف البحث بأنه اختبار قدرة الوكيل على إتمام عملية متعددة المراحل مع الحفاظ على قواعد العمل والتحقق من النتيجة بمقارنتها بالمتطلبات الأصلية.

كيفية قياس الإنجاز

ساعد موظفو Ironclad وأشخاص يستخدمون Ironclad في OpenAI على تحديد 11 مهمة. وقُيّمت كل مهمة وفق 8 إلى 50 معيارًا، بحسب مستوى صعوبتها. وقدمت Ironclad بيئات مستضافة لبرامجها لتدريب النماذج، وتقول OpenAI إنها حسّنت النماذج باستخدام مهام اصطناعية والتعلّم المعزز.

استخدمت المقارنة إعدادات حقق فيها كل نموذج أعلى درجاته: Max reasoning لـAstra وHigh reasoning لـSol. ووفقًا للجدول الذي نشرته OpenAI، بلغ متوسط الزمن التقديري للمحاولة 19,2 دقيقة لـAstra و37,0 دقيقة لـSol. وهذه تقديرات محاكاة تستند إلى السرعة المفترضة للمعالجة والتوليد، وليست قياسًا للوقت الذي وفره العملاء.

ما الذي تكشفه النتائج؟

يوضح التقييم كيف يمكن اختبار وكيل حاسوبي استنادًا إلى الحالة النهائية لمسار عمل معقد: إذ تتيح مجموعة المعايير معرفة المتطلبات التي نفذها النظام وتلك التي أغفلها. وبالنسبة إلى الشركات التي تقيّم أدوات مماثلة، يتمثل المؤشر العملي في فحص ما هو أبعد من الإجراءات المنفردة في الواجهة، والنظر أيضًا في كيفية تعامل مسار العمل المُعدّ مع الظروف المختلفة، مثل عتبات الموافقة والاستثناءات.

Unsplash Power
Domenico Loia · ترخيص Unsplash

تقتصر الأرقام على 11 مهمة بحثية، ولا تصف جميع مسارات العمل في Ironclad. وفي مثال منفصل من المنشور، أنجز Astra نحو 94% من المعايير خلال 20 دقيقة تقديريًا، بينما أنجز Sol نحو 85% خلال 32 دقيقة؛ وهذا مثال على مهمة واحدة، وليس متوسطًا للأداء. وتشير OpenAI أيضًا إلى أنها أنشأت المهام الاصطناعية استنادًا إلى عقود عامة من قاعدة بيانات SEC EDGAR بعد تصفية البيانات الشخصية؛ ووفقًا للشركة، لم تُستخدم عقود العملاء غير المنشورة في التدريب أو التقييم.

وشددت سونيتا فارما، المديرة التقنية في Ironclad، على أهمية مسار العمل المتكامل. وفي ترجمة الاقتباس الوارد في منشور OpenAI: «يحتاج الوكلاء إلى فهم دورة حياة العقد كاملة، بما في ذلك ترابط مسارات العمل، مع الحفاظ على مستوى التحكم الذي تعتمد عليه الفرق».

وتصف OpenAI التعاون بأنه عمل بحثي لتدريب النماذج وتقييمها. وتقدم الدرجات المنشورة لمحة عن النتائج في المهام المختارة؛ لكن المنشور لا يتضمن تحققًا مستقلًا من التقييم أو قياسات للأداء على مجموعة أوسع من مسارات عمل العملاء.

Keep readingGitHub تطلق ReviewBench لمقارنة مراجعي الذكاء الاصطناعي عبر العيوب التي يكتشفونها
Read the next article

مقالات ذات صلة

Breaking News · الأخبار

GitHub تطلق ReviewBench لمقارنة مراجعي الذكاء الاصطناعي عبر العيوب التي يكتشفونها

في 5 أكتوبر، كشفت GitHub عن ReviewBench، وهو إصدار بحثي أولي لمعيار مخصص لوكلاء مراجعة الشيفرات. تفصل مقاييسه بين المشكلات المكتشفة والمفوّتة والضوضاء الزائدة، بينما تصف نتائج اختبار A/B الداخلي للشركة تجربة بعينها، لا تصنيفًا عامًا للنماذج.

Launches · الأخبار

أصبح Mistral Large 4 متاحًا عبر API — والأوزان المفتوحة لاحقًا

أتاحت Mistral اختبار Large 4 عبر API، وحددت نهاية أكتوبر موعدًا مستهدفًا لإصدار الأوزان. وتصف الوثائق نموذج MoE بإدخال متعدد الوسائط وسياق يصل إلى مليون رمز؛ لكن أرقام المعلمات المنشورة في الوثائق والإعلان تختلف.

Breaking News · الأخبار

GPT-Rosalind: بدء تطبيق الأسعار دون إتاحة API للجميع

حددت OpenAI أسعار GPT-Rosalind اعتبارًا من 5 أكتوبر 2026، لكنها قصرت استخدام API على مهام البحث الداخلي المعتمدة. وبالنسبة إلى الفرق، فإن التحقق من الأهلية أهم من حساب الميزانية.

Breaking News · الأخبار

طلبات مواقع حكومية: ما الذي أثبتته آثار وكلاء الذكاء الاصطناعي وما الذي لم تثبته

أعادت Transluce بناء طلبات إلى مواقع في الولايات المتحدة وكندا، بما في ذلك اختبارات شبيهة بحقن SQL. نستعرض ما رصده الباحثون تحديدًا، وأين تقف حدود الإسناد، وما الذي يمكن لمشغلي المواقع وواجهات API الاستفادة منه.

حوّل ما تقرأه إلى تكامل عملي

استكشف واجهات API للبيانات الاجتماعية من jsonscraper واختبر الطلبات وأنشئ سير عملك التالي.

استكشف واجهات API