jsonscraper

OpenAI и Ironclad оценили ИИ-агентов на 11 договорных задачах

GPT‑6 Astra набрала в среднем 55% по критериям OpenAI; время выполнения компания оценила симуляцией

OpenAI и Ironclad 6 октября 2026 года опубликовали результаты исследовательской оценки ИИ-агентов, работающих с договорными процессами в корпоративном ПО. В 11 задачах GPT‑6 Astra набрала средний балл 55,0% по критериям выполнения, а GPT‑5.6 Sol — 41,6%.

OpenAI и Ironclad оценили ИИ-агентов на 11 договорных задачах
Context: В опубликованной 6 октября оценке OpenAI сравнила GPT‑6 Astra и GPT‑5.6 Sol на 11 задачах в юридических, коммерческих и закупочных процессах Ironclad. Результаты описывают исследовательский набор, а не все рабочие процессы платформы.
Visual subject: contract management legal workflow office documents computer Unsplash
OpenAI · AI-generated image

Задачи охватывали юридическую, коммерческую и закупочную работу: например, настройку соглашения о неразглашении, создание согласований закупок и изменение типового юридического положения с учётом выбранной юрисдикции. OpenAI описывает цель исследования как проверку способности агента пройти многоэтапный процесс, сохраняя бизнес-правила и сверяя результат с исходными требованиями.

Как измеряли выполнение

Сотрудники Ironclad и люди, использующие Ironclad в OpenAI, помогли определить 11 задач. Каждую оценивали по 8–50 критериям в зависимости от сложности. Для практики моделей Ironclad предоставила размещённые среды своего ПО; OpenAI сообщает, что улучшала модели с помощью синтетических задач и обучения с подкреплением.

В сравнении использовали настройки, на которых каждая модель показала свой наивысший балл: Max reasoning для Astra и High reasoning для Sol. По опубликованной OpenAI таблице, среднее расчётное время попытки составило 19,2 минуты у Astra и 37,0 минуты у Sol. Это симулированные оценки на основе предполагаемой скорости обработки и генерации, а не измеренное сокращение времени клиентов.

Что говорят результаты

Оценка показывает, как можно проверять компьютерного агента по итоговому состоянию сложного рабочего процесса: набор критериев позволяет увидеть, какие требования система выполнила, а какие пропустила. Для компаний, оценивающих подобные инструменты, практический ориентир — проверять не только отдельные действия в интерфейсе, но и то, как настроенный процесс обрабатывает разные условия, например пороги согласования и исключения.

Unsplash Power
Domenico Loia · Unsplash License

Числа относятся к 11 исследовательским задачам и не описывают все рабочие процессы Ironclad. В отдельном примере из публикации Astra выполнила около 94% критериев за оценочные 20 минут, а Sol — около 85% за 32 минуты; это пример одной задачи, а не средние показатели. OpenAI также указывает, что синтетические задачи создали на основе публичных договоров из базы SEC EDGAR после фильтрации персональных данных; по заявлению компании, закрытые договоры клиентов для обучения и оценки не использовались.

Сунита Верма, технический директор Ironclad, подчеркнула важность целостного рабочего процесса. В переводе цитаты из публикации OpenAI: «Агентам нужно понимать весь жизненный цикл договора, включая связь рабочих процессов, и сохранять контроль, на который полагаются команды».

OpenAI называет сотрудничество исследовательской работой по обучению и оценке моделей. Опубликованные баллы дают представление о результатах на выбранных задачах; публикация не приводит независимой проверки оценки или замеров работы на более широком наборе клиентских процессов.

Читайте дальшеGitHub открыла ReviewBench: ИИ-ревьюеров будут сравнивать по найденным дефектам
Читать следующую статью

Похожие материалы

Breaking News · Новости

GitHub открыла ReviewBench: ИИ-ревьюеров будут сравнивать по найденным дефектам

5 октября GitHub представила ReviewBench — исследовательское превью бенчмарка для агентов, проверяющих код. Его метрики разделяют найденные проблемы, пропуски и лишний шум, а результаты внутреннего A/B-теста компании описывают отдельный эксперимент, а не общий рейтинг моделей.

Launches · Новости

Mistral Large 4 уже доступна через API — открытые веса обещаны позже

Mistral открыла Large 4 для тестирования через API, а выпуск весов запланировала на конец октября. Документация описывает MoE-модель с мультимодальным вводом и контекстом до миллиона токенов; опубликованные цифры параметров в документации и анонсе различаются.

Breaking News · Новости

Запросы к госcайтам: что доказали следы ИИ-агентов — и чего нет

Transluce восстановила обращения к сайтам США и Канады, включая SQL-подобные пробы. Разбираем, что именно наблюдали исследователи, где заканчивается атрибуция и что из этой истории полезно операторам сайтов и API.

Превратите прочитанное в рабочую интеграцию

Изучайте API социальных данных jsonscraper, тестируйте запросы и создавайте новые процессы.

Смотреть API