Le 6 octobre 2026, OpenAI et Ironclad ont publié les résultats d’une évaluation de recherche d’agents d’IA intervenant dans des processus contractuels au sein de logiciels d’entreprise. Sur 11 tâches, GPT‑6 Astra a obtenu un score moyen de 55,0 % selon les critères d’exécution, contre 41,6 % pour GPT‑5.6 Sol.

Les tâches couvraient les activités juridiques, commerciales et d’approvisionnement : par exemple, configurer un accord de confidentialité, créer des circuits d’approbation des achats et modifier une clause juridique standard en fonction de la juridiction choisie. OpenAI décrit l’objectif de l’étude comme une vérification de la capacité d’un agent à mener un processus en plusieurs étapes, tout en respectant les règles métier et en comparant le résultat aux exigences initiales.
Comment l’exécution a été mesurée
Des employés d’Ironclad et des personnes utilisant Ironclad chez OpenAI ont contribué à définir les 11 tâches. Chacune était évaluée selon 8 à 50 critères, en fonction de sa complexité. Pour entraîner les modèles, Ironclad a fourni des environnements hébergés de son logiciel ; OpenAI indique avoir amélioré les modèles à l’aide de tâches synthétiques et de l’apprentissage par renforcement.
La comparaison a utilisé les paramètres auxquels chaque modèle avait obtenu son meilleur score : Max reasoning pour Astra et High reasoning pour Sol. Selon le tableau publié par OpenAI, le temps moyen estimé par tentative était de 19,2 minutes pour Astra et de 37,0 minutes pour Sol. Il s’agit d’estimations simulées fondées sur les vitesses supposées de traitement et de génération, et non d’une réduction du temps mesurée chez les clients.
Ce que montrent les résultats
L’évaluation montre comment tester un agent informatique à partir de l’état final d’un flux de travail complexe : un ensemble de critères permet de voir quelles exigences le système a satisfaites et lesquelles il a omises. Pour les entreprises qui évaluent des outils de ce type, le repère pratique consiste à vérifier non seulement les actions isolées dans l’interface, mais aussi la façon dont le processus configuré gère différentes conditions, telles que les seuils d’approbation et les exceptions.
Les chiffres concernent 11 tâches de recherche et ne décrivent pas l’ensemble des flux de travail d’Ironclad. Dans un exemple distinct présenté dans la publication, Astra a satisfait environ 94 % des critères en 20 minutes estimées, contre environ 85 % en 32 minutes pour Sol ; il s’agit d’un exemple portant sur une seule tâche, et non de résultats moyens. OpenAI indique également que les tâches synthétiques ont été créées à partir de contrats publics issus de la base SEC EDGAR, après filtrage des données personnelles ; selon l’entreprise, les contrats confidentiels des clients n’ont pas été utilisés pour l’entraînement ni l’évaluation.
Sunita Verma, directrice technique d’Ironclad, a souligné l’importance d’une vision globale du flux de travail. Traduction d’une citation de la publication d’OpenAI : « Les agents doivent comprendre tout le cycle de vie d’un contrat, y compris les liens entre les flux de travail, tout en préservant le contrôle sur lequel les équipes comptent. »
OpenAI présente cette collaboration comme un travail de recherche sur l’entraînement et l’évaluation des modèles. Les scores publiés donnent une indication des résultats sur les tâches sélectionnées ; la publication ne fournit ni vérification indépendante de l’évaluation ni mesures des performances sur un éventail plus large de processus clients.
Traduction de la citation : « Les agents doivent comprendre tout le cycle de vie d’un contrat, y compris les liens entre les flux de travail, tout en préservant le contrôle sur lequel les équipes comptent. »