jsonscraper

OpenAI ו-Ironclad העריכו סוכני AI ב-11 משימות חוזיות

GPT‑6 Astra השיגה ציון ממוצע של 55% לפי הקריטריונים של OpenAI; זמן הביצוע הוערך באמצעות סימולציה

OpenAI ו-Ironclad פרסמו ב-6 באוקטובר 2026 את תוצאותיה של הערכה מחקרית של סוכני AI העובדים עם תהליכים חוזיים בתוכנות ארגוניות. ב-11 משימות קיבלה GPT‑6 Astra ציון ממוצע של 55.0% בקריטריוני הביצוע, ואילו GPT‑5.6 Sol קיבלה 41.6%.

OpenAI ו-Ironclad העריכו סוכני AI ב-11 משימות חוזיות
הקשר: בהערכה שפורסמה ב-6 באוקטובר השוותה OpenAI בין GPT‑6 Astra ל-GPT‑5.6 Sol ב-11 משימות בתהליכים משפטיים, מסחריים ורכש של Ironclad. התוצאות מתייחסות למערך מחקרי, ולא לכל תהליכי העבודה של הפלטפורמה.
נושא חזותי: ניהול חוזים, תהליך עבודה משפטי, משרד, מסמכים, מחשב, Unsplash
OpenAI · תמונה שנוצרה באמצעות AI

המשימות עסקו בעבודה משפטית, מסחרית וברכש. למשל, הן כללו הגדרת הסכם סודיות, יצירת תהליכי אישור לרכש ושינוי סעיף משפטי סטנדרטי בהתאם לתחום השיפוט שנבחר. OpenAI מתארת את מטרת המחקר כבדיקת יכולתו של סוכן להשלים תהליך רב-שלבי, תוך שמירה על כללי העסק והתאמת התוצאה לדרישות המקוריות.

כיצד נמדדה הביצועיות

עובדי Ironclad ואנשים ב-OpenAI המשתמשים ב-Ironclad סייעו להגדיר 11 משימות. כל משימה נבדקה לפי 8–50 קריטריונים, בהתאם למורכבותה. כדי לאמן את המודלים סיפקה Ironclad סביבות מתארחות של התוכנה שלה; OpenAI מדווחת כי שיפרה את המודלים באמצעות משימות סינתטיות ולמידת חיזוק.

בהשוואה השתמשו בהגדרות שבהן כל מודל השיג את הציון הגבוה ביותר שלו: Max reasoning עבור Astra ו-High reasoning עבור Sol. לפי הטבלה שפרסמה OpenAI, זמן הניסיון הממוצע המחושב היה 19.2 דקות עבור Astra ו-37.0 דקות עבור Sol. אלה הערכות מדומות המבוססות על מהירות עיבוד ויצירה משוערת, ולא מדידה של קיצור זמן העבודה ללקוחות.

מה מלמדות התוצאות

ההערכה מדגימה דרך לבחון סוכן מחשב לפי התוצאה הסופית של תהליך עבודה מורכב: מערך הקריטריונים מאפשר לראות אילו דרישות המערכת מילאה ואילו החמיצה. עבור חברות הבוחנות כלים דומים, נקודת המוצא המעשית היא לבדוק לא רק פעולות בודדות בממשק, אלא גם כיצד התהליך שהוגדר מטפל בתנאים שונים, כגון ספי אישור וחריגים.

Unsplash Power
Domenico Loia · רישיון Unsplash

המספרים מתייחסים ל-11 משימות מחקריות ואינם מתארים את כל תהליכי העבודה של Ironclad. בדוגמה נפרדת מהפרסום, Astra עמדה בכ-94% מהקריטריונים בתוך 20 דקות משוערות, ו-Sol עמדה בכ-85% בתוך 32 דקות; זו דוגמה למשימה אחת, ולא נתונים ממוצעים. OpenAI מציינת גם שהמשימות הסינתטיות נוצרו על בסיס חוזים פומביים ממאגר SEC EDGAR, לאחר סינון מידע אישי; לטענת החברה, חוזים חסויים של לקוחות לא שימשו לאימון או להערכה.

סוניטה ורמה, סמנכ״לית הטכנולוגיה של Ironclad, הדגישה את חשיבותו של תהליך העבודה הכולל. בתרגום הציטוט מתוך הפרסום של OpenAI: «סוכנים צריכים להבין את כל מחזור החיים של החוזה, כולל את הקשר בין תהליכי העבודה, ולשמר את הבקרה שעליה הצוותים מסתמכים».

OpenAI מגדירה את שיתוף הפעולה כמחקר בתחום אימון והערכת מודלים. הציונים שפורסמו מספקים תמונה של התוצאות במשימות שנבחרו; הפרסום אינו כולל אימות עצמאי של ההערכה או מדידות ביצועים במערך רחב יותר של תהליכי לקוחות.

Keep readingGitHub משיקה את ReviewBench: סוקרי קוד מבוססי AI יושוו לפי הבאגים שהם מוצאים
Read the next article

כתבות קשורות

Breaking News · חדשות

GitHub משיקה את ReviewBench: סוקרי קוד מבוססי AI יושוו לפי הבאגים שהם מוצאים

ב־5 באוקטובר הציגה GitHub את ReviewBench — גרסת תצוגה מוקדמת למחקר של מדד לסוכנים שבודקים קוד. המדדים שלו מבחינים בין בעיות שהתגלו, בעיות שלא זוהו והערות מיותרות; תוצאות מבחן ה־A/B הפנימי של החברה מתארות ניסוי מסוים ולא דירוג כללי של מודלים.

הפכו את מה שקראתם לאינטגרציה עובדת

גלו את ממשקי ה-API לנתונים חברתיים של jsonscraper, בדקו בקשות ובנו את תהליך העבודה הבא.

גלה API