OpenAI и Ironclad 6 октября 2026 года опубликовали результаты исследовательской оценки ИИ-агентов, работающих с договорными процессами в корпоративном ПО. В 11 задачах GPT‑6 Astra набрала средний балл 55,0% по критериям выполнения, а GPT‑5.6 Sol — 41,6%.

Задачи охватывали юридическую, коммерческую и закупочную работу: например, настройку соглашения о неразглашении, создание согласований закупок и изменение типового юридического положения с учётом выбранной юрисдикции. OpenAI описывает цель исследования как проверку способности агента пройти многоэтапный процесс, сохраняя бизнес-правила и сверяя результат с исходными требованиями.
Как измеряли выполнение
Сотрудники Ironclad и люди, использующие Ironclad в OpenAI, помогли определить 11 задач. Каждую оценивали по 8–50 критериям в зависимости от сложности. Для практики моделей Ironclad предоставила размещённые среды своего ПО; OpenAI сообщает, что улучшала модели с помощью синтетических задач и обучения с подкреплением.
В сравнении использовали настройки, на которых каждая модель показала свой наивысший балл: Max reasoning для Astra и High reasoning для Sol. По опубликованной OpenAI таблице, среднее расчётное время попытки составило 19,2 минуты у Astra и 37,0 минуты у Sol. Это симулированные оценки на основе предполагаемой скорости обработки и генерации, а не измеренное сокращение времени клиентов.
Что говорят результаты
Оценка показывает, как можно проверять компьютерного агента по итоговому состоянию сложного рабочего процесса: набор критериев позволяет увидеть, какие требования система выполнила, а какие пропустила. Для компаний, оценивающих подобные инструменты, практический ориентир — проверять не только отдельные действия в интерфейсе, но и то, как настроенный процесс обрабатывает разные условия, например пороги согласования и исключения.
Числа относятся к 11 исследовательским задачам и не описывают все рабочие процессы Ironclad. В отдельном примере из публикации Astra выполнила около 94% критериев за оценочные 20 минут, а Sol — около 85% за 32 минуты; это пример одной задачи, а не средние показатели. OpenAI также указывает, что синтетические задачи создали на основе публичных договоров из базы SEC EDGAR после фильтрации персональных данных; по заявлению компании, закрытые договоры клиентов для обучения и оценки не использовались.
Сунита Верма, технический директор Ironclad, подчеркнула важность целостного рабочего процесса. В переводе цитаты из публикации OpenAI: «Агентам нужно понимать весь жизненный цикл договора, включая связь рабочих процессов, и сохранять контроль, на который полагаются команды».
OpenAI называет сотрудничество исследовательской работой по обучению и оценке моделей. Опубликованные баллы дают представление о результатах на выбранных задачах; публикация не приводит независимой проверки оценки или замеров работы на более широком наборе клиентских процессов.
Перевод цитаты: «Агентам нужно понимать весь жизненный цикл договора, включая связь рабочих процессов, и сохранять контроль, на который полагаются команды».