OpenAI ו-Ironclad פרסמו ב-6 באוקטובר 2026 את תוצאותיה של הערכה מחקרית של סוכני AI העובדים עם תהליכים חוזיים בתוכנות ארגוניות. ב-11 משימות קיבלה GPT‑6 Astra ציון ממוצע של 55.0% בקריטריוני הביצוע, ואילו GPT‑5.6 Sol קיבלה 41.6%.

המשימות עסקו בעבודה משפטית, מסחרית וברכש. למשל, הן כללו הגדרת הסכם סודיות, יצירת תהליכי אישור לרכש ושינוי סעיף משפטי סטנדרטי בהתאם לתחום השיפוט שנבחר. OpenAI מתארת את מטרת המחקר כבדיקת יכולתו של סוכן להשלים תהליך רב-שלבי, תוך שמירה על כללי העסק והתאמת התוצאה לדרישות המקוריות.
כיצד נמדדה הביצועיות
עובדי Ironclad ואנשים ב-OpenAI המשתמשים ב-Ironclad סייעו להגדיר 11 משימות. כל משימה נבדקה לפי 8–50 קריטריונים, בהתאם למורכבותה. כדי לאמן את המודלים סיפקה Ironclad סביבות מתארחות של התוכנה שלה; OpenAI מדווחת כי שיפרה את המודלים באמצעות משימות סינתטיות ולמידת חיזוק.
בהשוואה השתמשו בהגדרות שבהן כל מודל השיג את הציון הגבוה ביותר שלו: Max reasoning עבור Astra ו-High reasoning עבור Sol. לפי הטבלה שפרסמה OpenAI, זמן הניסיון הממוצע המחושב היה 19.2 דקות עבור Astra ו-37.0 דקות עבור Sol. אלה הערכות מדומות המבוססות על מהירות עיבוד ויצירה משוערת, ולא מדידה של קיצור זמן העבודה ללקוחות.
מה מלמדות התוצאות
ההערכה מדגימה דרך לבחון סוכן מחשב לפי התוצאה הסופית של תהליך עבודה מורכב: מערך הקריטריונים מאפשר לראות אילו דרישות המערכת מילאה ואילו החמיצה. עבור חברות הבוחנות כלים דומים, נקודת המוצא המעשית היא לבדוק לא רק פעולות בודדות בממשק, אלא גם כיצד התהליך שהוגדר מטפל בתנאים שונים, כגון ספי אישור וחריגים.
המספרים מתייחסים ל-11 משימות מחקריות ואינם מתארים את כל תהליכי העבודה של Ironclad. בדוגמה נפרדת מהפרסום, Astra עמדה בכ-94% מהקריטריונים בתוך 20 דקות משוערות, ו-Sol עמדה בכ-85% בתוך 32 דקות; זו דוגמה למשימה אחת, ולא נתונים ממוצעים. OpenAI מציינת גם שהמשימות הסינתטיות נוצרו על בסיס חוזים פומביים ממאגר SEC EDGAR, לאחר סינון מידע אישי; לטענת החברה, חוזים חסויים של לקוחות לא שימשו לאימון או להערכה.
סוניטה ורמה, סמנכ״לית הטכנולוגיה של Ironclad, הדגישה את חשיבותו של תהליך העבודה הכולל. בתרגום הציטוט מתוך הפרסום של OpenAI: «סוכנים צריכים להבין את כל מחזור החיים של החוזה, כולל את הקשר בין תהליכי העבודה, ולשמר את הבקרה שעליה הצוותים מסתמכים».
OpenAI מגדירה את שיתוף הפעולה כמחקר בתחום אימון והערכת מודלים. הציונים שפורסמו מספקים תמונה של התוצאות במשימות שנבחרו; הפרסום אינו כולל אימות עצמאי של ההערכה או מדידות ביצועים במערך רחב יותר של תהליכי לקוחות.
תרגום הציטוט: «סוכנים צריכים להבין את כל מחזור החיים של החוזה, כולל את הקשר בין תהליכי העבודה, ולשמר את הבקרה שעליה הצוותים מסתמכים».