OpenAI와 Ironclad는 2026년 10월 6일 기업용 소프트웨어의 계약 업무를 처리하는 AI 에이전트에 대한 연구 평가 결과를 공개했다. 11개 과제에서 GPT‑6 Astra는 수행 기준 평균 55.0%를 기록했고, GPT‑5.6 Sol은 41.6%를 기록했다.

과제에는 법무, 상업, 조달 업무가 포함됐다. 예를 들어 비밀유지계약 설정, 조달 승인 절차 생성, 선택한 관할권에 맞춘 표준 법률 조항 수정 등이 있었다. OpenAI는 이 연구의 목표가 비즈니스 규칙을 유지하고 결과를 원래 요구사항과 대조하면서 에이전트가 여러 단계로 이루어진 업무 흐름을 수행할 수 있는지 확인하는 것이라고 설명한다.
수행 능력 측정 방법
Ironclad 직원들과 OpenAI에서 Ironclad를 사용하는 사람들이 11개 과제를 정의하는 데 도움을 줬다. 각 과제는 난이도에 따라 8~50개 기준으로 평가됐다. 모델 훈련을 위해 Ironclad는 자사 소프트웨어를 호스팅한 환경을 제공했고, OpenAI는 합성 과제와 강화 학습을 사용해 모델을 개선했다고 밝혔다.
비교에는 각 모델이 가장 높은 점수를 받은 설정, 즉 Astra의 Max reasoning과 Sol의 High reasoning을 사용했다. OpenAI가 공개한 표에 따르면 시도 1회당 평균 추정 시간은 Astra가 19.2분, Sol이 37.0분이었다. 이는 예상 처리 및 생성 속도를 토대로 한 시뮬레이션 추정치이지, 고객의 업무 시간이 실제로 단축됐음을 측정한 결과는 아니다.
결과가 보여주는 점
이번 평가는 복잡한 업무 흐름의 최종 상태를 기준으로 컴퓨터 에이전트를 점검하는 방법을 보여준다. 기준별 결과를 통해 시스템이 어떤 요구사항을 충족했고 무엇을 놓쳤는지 확인할 수 있다. 유사한 도구를 평가하는 기업이라면 인터페이스에서 개별 동작을 확인하는 데 그치지 않고 승인 기준이나 예외 등 여러 조건에 맞춰 설정된 업무 절차가 어떻게 작동하는지도 점검해야 한다.
수치는 연구용 11개 과제에만 해당하며 Ironclad의 모든 업무 흐름을 설명하지 않는다. 공개 자료의 별도 사례에서 Astra는 평가상 20분 동안 기준의 약 94%를 충족했고, Sol은 32분 동안 약 85%를 충족했다. 이는 단일 과제의 사례이지 평균 성과가 아니다. OpenAI는 또한 개인정보를 걸러낸 뒤 SEC EDGAR 데이터베이스의 공개 계약을 바탕으로 합성 과제를 만들었다고 밝혔다. 회사의 설명에 따르면 고객의 비공개 계약은 훈련이나 평가에 사용되지 않았다.
Ironclad의 최고기술책임자 수니타 베르마는 전체 업무 흐름의 중요성을 강조했다. OpenAI 게시물에 실린 발언을 번역하면 다음과 같다. “에이전트는 업무 흐름 간의 연계를 포함해 계약의 전체 수명 주기를 이해하고, 팀이 의지하는 통제력을 유지해야 합니다.”
OpenAI는 이번 협력을 모델 훈련 및 평가를 위한 연구 작업이라고 설명한다. 공개된 점수는 선택된 과제에서의 성과를 보여주지만, 게시물에는 평가에 대한 독립적인 검증이나 더 폭넓은 고객 업무 절차에서의 성능 측정 결과가 제시되지 않았다.
인용문 번역: “에이전트는 업무 흐름 간의 연계를 포함해 계약의 전체 수명 주기를 이해하고, 팀이 의지하는 통제력을 유지해야 합니다.”