2026 年 10 月 6 日,OpenAI 与 Ironclad 发布了一项研究评估结果,评估在企业软件中处理合同流程的 AI 代理。在 11 项任务中,GPT‑6 Astra 按完成标准的平均得分为 55.0%,GPT‑5.6 Sol 则为 41.6%。

这些任务涵盖法律、商务和采购工作,例如设置保密协议、创建采购审批流程,以及根据选定的司法管辖区修改标准法律条款。OpenAI 表示,研究旨在检验代理能否完成多步骤流程,同时遵守业务规则,并依据最初的要求核对结果。
如何衡量任务完成情况
Ironclad 员工以及在 OpenAI 使用 Ironclad 的人员参与制定了这 11 项任务。根据任务复杂程度,每项任务按 8 至 50 条标准进行评估。Ironclad 为模型练习提供了其软件的托管环境;OpenAI 表示,他们通过合成任务和强化学习改进模型。
比较时采用了各模型得分最高的设置:Astra 使用 Max reasoning,Sol 使用 High reasoning。根据 OpenAI 发布的表格,Astra 每次尝试的平均估算耗时为 19.2 分钟,Sol 为 37.0 分钟。这些时间是根据假设的处理和生成速度模拟估算的,并非客户实际节省时间的测量结果。
结果说明了什么
这项评估展示了如何通过复杂工作流程的最终状态来检验计算机代理:一组标准可以显示系统满足了哪些要求、遗漏了哪些要求。对于正在评估此类工具的企业,实际启示是,不仅要检查界面中的单项操作,还要检验配置好的流程如何处理不同条件,例如审批门槛和例外情况。
这些数字仅针对 11 项研究任务,并不代表 Ironclad 的所有工作流程。在发布内容中的一个单独示例里,Astra 在估算 20 分钟内完成了约 94% 的评估标准,Sol 则在 32 分钟内完成约 85%;这是单项任务的示例,并非平均表现。OpenAI 还指出,合成任务基于 SEC EDGAR 数据库中的公开合同创建,并经过个人数据筛选;据该公司称,训练和评估未使用客户的非公开合同。
Ironclad 首席技术官苏妮塔·维尔马强调了端到端工作流程的重要性。以下为 OpenAI 发布内容中引述的译文:“代理需要理解合同的整个生命周期,包括工作流程之间的衔接,同时保留团队所依赖的控制权。”
OpenAI 将此次合作称为一项模型训练与评估研究。已发布的分数呈现了模型在所选任务上的表现;发布内容未提供独立评估验证,也未报告模型在更广泛客户流程中的表现测量。
引文译文:“代理需要理解合同的整个生命周期,包括工作流程之间的衔接,同时保留团队所依赖的控制权。”