jsonscraper

OpenAI та Ironclad оцінили ШІ-агентів на 11 завданнях із договорами

GPT‑6 Astra набрала в середньому 55% за критеріями OpenAI; час виконання компанія оцінила за допомогою симуляції

OpenAI та Ironclad 6 жовтня 2026 року опублікували результати дослідницького оцінювання ШІ-агентів, які працюють із договірними процесами в корпоративному програмному забезпеченні. У 11 завданнях GPT‑6 Astra набрала середній бал 55,0% за критеріями виконання, а GPT‑5.6 Sol — 41,6%.

OpenAI та Ironclad оцінили ШІ-агентів на 11 завданнях із договорами
Контекст: В опублікованому 6 жовтня оцінюванні OpenAI порівняла GPT‑6 Astra і GPT‑5.6 Sol на 11 завданнях у юридичних, комерційних і закупівельних процесах Ironclad. Результати стосуються дослідницького набору завдань, а не всіх робочих процесів платформи.
Візуальна тема: управління договорами, юридичний робочий процес, офіс, документи, комп’ютер, Unsplash
OpenAI · зображення, створене ШІ

Завдання охоплювали юридичну, комерційну та закупівельну роботу: наприклад, налаштування угоди про нерозголошення, створення погоджень закупівель і зміну типового юридичного положення з урахуванням обраної юрисдикції. OpenAI описує мету дослідження як перевірку здатності агента пройти багатоетапний процес, дотримуючись бізнес-правил і звіряючи результат із початковими вимогами.

Як вимірювали виконання

Співробітники Ironclad і люди, які користуються Ironclad в OpenAI, допомогли визначити 11 завдань. Кожне оцінювали за 8–50 критеріями залежно від складності. Для практичної роботи моделей Ironclad надала розміщені середовища свого програмного забезпечення; OpenAI повідомляє, що вдосконалювала моделі за допомогою синтетичних завдань і навчання з підкріпленням.

У порівнянні використали налаштування, за яких кожна модель показала свій найвищий бал: Max reasoning для Astra і High reasoning для Sol. За опублікованою OpenAI таблицею, середній розрахунковий час спроби становив 19,2 хвилини для Astra і 37,0 хвилини для Sol. Це симульовані оцінки на основі передбачуваної швидкості обробки та генерації, а не виміряне скорочення часу для клієнтів.

Що показують результати

Оцінювання показує, як можна перевіряти комп’ютерного агента за підсумковим станом складного робочого процесу: набір критеріїв дає змогу побачити, які вимоги система виконала, а які пропустила. Для компаній, що оцінюють подібні інструменти, практичний орієнтир — перевіряти не лише окремі дії в інтерфейсі, а й те, як налаштований процес обробляє різні умови, наприклад пороги погодження та винятки.

Unsplash Power
Domenico Loia · Ліцензія Unsplash

Ці числа стосуються 11 дослідницьких завдань і не описують усі робочі процеси Ironclad. В окремому прикладі з публікації Astra виконала близько 94% критеріїв за розрахункові 20 хвилин, а Sol — близько 85% за 32 хвилини; це приклад одного завдання, а не середні показники. OpenAI також зазначає, що синтетичні завдання створили на основі публічних договорів із бази SEC EDGAR після фільтрування персональних даних; за заявою компанії, закриті договори клієнтів не використовували для навчання й оцінювання.

Суніта Верма, технічна директорка Ironclad, наголосила на важливості цілісного робочого процесу. У перекладі цитати з публікації OpenAI: «Агентам потрібно розуміти весь життєвий цикл договору, зокрема зв’язок між робочими процесами, і зберігати контроль, на який покладаються команди».

OpenAI називає співпрацю дослідницькою роботою з навчання й оцінювання моделей. Опубліковані бали дають уявлення про результати на вибраних завданнях; у публікації немає незалежної перевірки оцінювання чи вимірювань роботи на ширшому наборі клієнтських процесів.

Keep readingGitHub представила ReviewBench: ІІ-рев’юерів порівнюватимуть за знайденими дефектами
Read the next article

Схожі матеріали

Breaking News · Новини

GitHub представила ReviewBench: ІІ-рев’юерів порівнюватимуть за знайденими дефектами

5 жовтня GitHub представила ReviewBench — дослідницьку попередню версію бенчмарку для агентів, які перевіряють код. Його метрики розділяють виявлені проблеми, пропуски й зайвий шум, а результати внутрішнього A/B-тесту компанії описують окремий експеримент, а не загальний рейтинг моделей.

Launches · Новини

Mistral Large 4 уже доступна через API — открытые веса обіцяють пізніше

Mistral відкрила Large 4 для тестування через API, а випуск ваг запланувала на кінець жовтня. Документація описує MoE-модель із мультимодальним введенням і контекстом до мільйона токенів; опубліковані цифри параметрів у документації та анонсі різняться.

Breaking News · Новини

Запити до державних сайтів: що доводять сліди ІІ-агентів — і чого ні

Transluce відновила звернення до сайтів США й Канади, зокрема спроби, схожі на SQL-запити. Розбираємо, що саме спостерігали дослідники, де закінчується атрибуція і чим ця історія може бути корисною операторам сайтів та API.

Перетворіть прочитане на робочу інтеграцію

Досліджуйте API соціальних даних jsonscraper, тестуйте запити й створюйте нові процеси.

Переглянути API