OpenAI та Ironclad 6 жовтня 2026 року опублікували результати дослідницького оцінювання ШІ-агентів, які працюють із договірними процесами в корпоративному програмному забезпеченні. У 11 завданнях GPT‑6 Astra набрала середній бал 55,0% за критеріями виконання, а GPT‑5.6 Sol — 41,6%.

Завдання охоплювали юридичну, комерційну та закупівельну роботу: наприклад, налаштування угоди про нерозголошення, створення погоджень закупівель і зміну типового юридичного положення з урахуванням обраної юрисдикції. OpenAI описує мету дослідження як перевірку здатності агента пройти багатоетапний процес, дотримуючись бізнес-правил і звіряючи результат із початковими вимогами.
Як вимірювали виконання
Співробітники Ironclad і люди, які користуються Ironclad в OpenAI, допомогли визначити 11 завдань. Кожне оцінювали за 8–50 критеріями залежно від складності. Для практичної роботи моделей Ironclad надала розміщені середовища свого програмного забезпечення; OpenAI повідомляє, що вдосконалювала моделі за допомогою синтетичних завдань і навчання з підкріпленням.
У порівнянні використали налаштування, за яких кожна модель показала свій найвищий бал: Max reasoning для Astra і High reasoning для Sol. За опублікованою OpenAI таблицею, середній розрахунковий час спроби становив 19,2 хвилини для Astra і 37,0 хвилини для Sol. Це симульовані оцінки на основі передбачуваної швидкості обробки та генерації, а не виміряне скорочення часу для клієнтів.
Що показують результати
Оцінювання показує, як можна перевіряти комп’ютерного агента за підсумковим станом складного робочого процесу: набір критеріїв дає змогу побачити, які вимоги система виконала, а які пропустила. Для компаній, що оцінюють подібні інструменти, практичний орієнтир — перевіряти не лише окремі дії в інтерфейсі, а й те, як налаштований процес обробляє різні умови, наприклад пороги погодження та винятки.
Ці числа стосуються 11 дослідницьких завдань і не описують усі робочі процеси Ironclad. В окремому прикладі з публікації Astra виконала близько 94% критеріїв за розрахункові 20 хвилин, а Sol — близько 85% за 32 хвилини; це приклад одного завдання, а не середні показники. OpenAI також зазначає, що синтетичні завдання створили на основі публічних договорів із бази SEC EDGAR після фільтрування персональних даних; за заявою компанії, закриті договори клієнтів не використовували для навчання й оцінювання.
Суніта Верма, технічна директорка Ironclad, наголосила на важливості цілісного робочого процесу. У перекладі цитати з публікації OpenAI: «Агентам потрібно розуміти весь життєвий цикл договору, зокрема зв’язок між робочими процесами, і зберігати контроль, на який покладаються команди».
OpenAI називає співпрацю дослідницькою роботою з навчання й оцінювання моделей. Опубліковані бали дають уявлення про результати на вибраних завданнях; у публікації немає незалежної перевірки оцінювання чи вимірювань роботи на ширшому наборі клієнтських процесів.
Переклад цитати: «Агентам потрібно розуміти весь життєвий цикл договору, зокрема зв’язок між робочими процесами, і зберігати контроль, на який покладаються команди».