jsonscraper

OpenAI와 Ironclad, 계약 업무 11개로 AI 에이전트 평가

GPT‑6 Astra는 OpenAI의 기준으로 평균 55%를 기록했으며, 실행 시간은 시뮬레이션으로 추정했다

OpenAI와 Ironclad는 2026년 10월 6일 기업용 소프트웨어의 계약 업무를 처리하는 AI 에이전트에 대한 연구 평가 결과를 공개했다. 11개 과제에서 GPT‑6 Astra는 수행 기준 평균 55.0%를 기록했고, GPT‑5.6 Sol은 41.6%를 기록했다.

OpenAI와 Ironclad, 계약 업무 11개로 AI 에이전트 평가
Context: 10월 6일 공개된 평가에서 OpenAI는 Ironclad의 법무·상업·조달 업무에 해당하는 11개 과제에서 GPT‑6 Astra와 GPT‑5.6 Sol을 비교했다. 결과는 연구용 과제 모음에 대한 것이며 플랫폼의 모든 업무 흐름을 대표하지는 않는다.
Visual subject: 계약 관리, 법무 업무 흐름, 사무실 문서, 컴퓨터, Unsplash
OpenAI · AI 생성 이미지

과제에는 법무, 상업, 조달 업무가 포함됐다. 예를 들어 비밀유지계약 설정, 조달 승인 절차 생성, 선택한 관할권에 맞춘 표준 법률 조항 수정 등이 있었다. OpenAI는 이 연구의 목표가 비즈니스 규칙을 유지하고 결과를 원래 요구사항과 대조하면서 에이전트가 여러 단계로 이루어진 업무 흐름을 수행할 수 있는지 확인하는 것이라고 설명한다.

수행 능력 측정 방법

Ironclad 직원들과 OpenAI에서 Ironclad를 사용하는 사람들이 11개 과제를 정의하는 데 도움을 줬다. 각 과제는 난이도에 따라 8~50개 기준으로 평가됐다. 모델 훈련을 위해 Ironclad는 자사 소프트웨어를 호스팅한 환경을 제공했고, OpenAI는 합성 과제와 강화 학습을 사용해 모델을 개선했다고 밝혔다.

비교에는 각 모델이 가장 높은 점수를 받은 설정, 즉 Astra의 Max reasoning과 Sol의 High reasoning을 사용했다. OpenAI가 공개한 표에 따르면 시도 1회당 평균 추정 시간은 Astra가 19.2분, Sol이 37.0분이었다. 이는 예상 처리 및 생성 속도를 토대로 한 시뮬레이션 추정치이지, 고객의 업무 시간이 실제로 단축됐음을 측정한 결과는 아니다.

결과가 보여주는 점

이번 평가는 복잡한 업무 흐름의 최종 상태를 기준으로 컴퓨터 에이전트를 점검하는 방법을 보여준다. 기준별 결과를 통해 시스템이 어떤 요구사항을 충족했고 무엇을 놓쳤는지 확인할 수 있다. 유사한 도구를 평가하는 기업이라면 인터페이스에서 개별 동작을 확인하는 데 그치지 않고 승인 기준이나 예외 등 여러 조건에 맞춰 설정된 업무 절차가 어떻게 작동하는지도 점검해야 한다.

Unsplash Power
Domenico Loia · Unsplash 라이선스

수치는 연구용 11개 과제에만 해당하며 Ironclad의 모든 업무 흐름을 설명하지 않는다. 공개 자료의 별도 사례에서 Astra는 평가상 20분 동안 기준의 약 94%를 충족했고, Sol은 32분 동안 약 85%를 충족했다. 이는 단일 과제의 사례이지 평균 성과가 아니다. OpenAI는 또한 개인정보를 걸러낸 뒤 SEC EDGAR 데이터베이스의 공개 계약을 바탕으로 합성 과제를 만들었다고 밝혔다. 회사의 설명에 따르면 고객의 비공개 계약은 훈련이나 평가에 사용되지 않았다.

Ironclad의 최고기술책임자 수니타 베르마는 전체 업무 흐름의 중요성을 강조했다. OpenAI 게시물에 실린 발언을 번역하면 다음과 같다. “에이전트는 업무 흐름 간의 연계를 포함해 계약의 전체 수명 주기를 이해하고, 팀이 의지하는 통제력을 유지해야 합니다.”

OpenAI는 이번 협력을 모델 훈련 및 평가를 위한 연구 작업이라고 설명한다. 공개된 점수는 선택된 과제에서의 성과를 보여주지만, 게시물에는 평가에 대한 독립적인 검증이나 더 폭넓은 고객 업무 절차에서의 성능 측정 결과가 제시되지 않았다.

Keep readingGitHub представила ReviewBench: ИИ-ревьюеров сравнят по найденным дефектам
Read the next article

관련 글

Breaking News · 뉴스

GitHub представила ReviewBench: ИИ-ревьюеров сравнят по найденным дефектам

5 октября GitHub представила ReviewBench — исследовательское превью бенчмарка для агентов, проверяющих код. Его метрики разделяют найденные проблемы, пропуски и лишний шум, а результаты внутреннего A/B-теста компании описывают отдельный эксперимент, а не общий рейтинг моделей.

Launches · 뉴스

Mistral Large 4, API로 먼저 공개… 오픈 웨이트는 추후 출시 예정

Mistral은 API를 통해 Large 4 테스트를 시작했으며, 웨이트는 10월 말 출시할 계획이다. 문서에는 멀티모달 입력을 지원하고 최대 100만 토큰의 컨텍스트를 처리하는 MoE 모델이라고 설명돼 있지만, 문서와 발표 자료에 공개된 파라미터 수는 서로 다르다.

읽은 내용을 실제 연동으로 구현하세요

jsonscraper 소셜 데이터 API를 살펴보고 요청을 테스트하여 다음 워크플로를 구축하세요.

API 둘러보기