OpenAIとIroncladは2026年10月6日、企業向けソフトウェアの契約業務を扱うAIエージェントの研究評価の結果を公開しました。11件のタスクにおける実行基準の平均スコアは、GPT‑6 Astraが55.0%、GPT‑5.6 Solが41.6%でした。

タスクは、秘密保持契約の設定、調達承認の作成、選択した法域に合わせた標準的な法務条項の変更など、法務、営業、調達業務を対象としていました。OpenAIによると、この研究の目的は、エージェントがビジネスルールを保ち、元の要件と照合しながら、多段階のプロセスを完了できるかを検証することです。
実行の評価方法
Ironcladの従業員と、OpenAIでIroncladを利用する人々が11件のタスクの策定に協力しました。各タスクは難易度に応じて8〜50項目の基準で評価されました。モデルの実践に向け、Ironcladは自社ソフトウェアのホスト環境を提供し、OpenAIは合成タスクと強化学習を用いてモデルを改善したと説明しています。
比較では、各モデルが最高スコアを記録した設定を使用しました。AstraはMax reasoning、SolはHigh reasoningです。OpenAIが公開した表によると、試行1回あたりの推定平均時間はAstraが19.2分、Solが37.0分でした。これは想定される処理速度と生成速度に基づくシミュレーション上の推定であり、顧客の作業時間が実際に短縮したことを測定したものではありません。
結果から分かること
この評価は、複雑なワークフローの最終状態を基準に、コンピューター操作エージェントを検証する方法を示しています。基準を設定すれば、システムがどの要件を満たし、どれを見落としたかを確認できます。同様のツールを評価する企業にとっては、インターフェース上の個々の操作だけでなく、承認しきい値や例外など、さまざまな条件を設定済みのプロセスがどう処理するかを確かめることが実務上の目安になります。
数値は研究用の11件のタスクに関するもので、Ironcladのすべてのワークフローを表すものではありません。公開資料の別の例では、Astraは推定20分で基準の約94%を達成し、Solは32分で約85%を達成しました。これは1件のタスクの例であり、平均値ではありません。OpenAIはまた、合成タスクをSEC EDGARデータベースの公開契約書をもとに作成し、個人情報を除外したとしています。同社によると、顧客の非公開契約書は学習にも評価にも使用していません。
Ironcladの最高技術責任者、スニタ・ヴェルマは、ワークフロー全体を把握することの重要性を強調しました。OpenAIの公開資料にある発言の翻訳は次のとおりです。「エージェントは、ワークフロー間の連携を含め、契約のライフサイクル全体を理解し、チームが頼りにしている管理を維持する必要があります。」
OpenAIは、この協業をモデルの学習と評価に関する研究と位置付けています。公開されたスコアは選定されたタスクでの結果を示すものです。評価の独立した検証や、より幅広い顧客業務における性能測定については、公開資料に記載されていません。
引用の翻訳:「エージェントは、ワークフロー間の連携を含め、契約のライフサイクル全体を理解し、チームが頼りにしている管理を維持する必要があります。」