jsonscraper

OpenAI et Ironclad évaluent des agents d’IA sur 11 tâches contractuelles

GPT‑6 Astra obtient une moyenne de 55 % selon les critères d’OpenAI ; le temps d’exécution est évalué par simulation

Le 6 octobre 2026, OpenAI et Ironclad ont publié les résultats d’une évaluation de recherche d’agents d’IA intervenant dans des processus contractuels au sein de logiciels d’entreprise. Sur 11 tâches, GPT‑6 Astra a obtenu un score moyen de 55,0 % selon les critères d’exécution, contre 41,6 % pour GPT‑5.6 Sol.

OpenAI et Ironclad évaluent des agents d’IA sur 11 tâches contractuelles
Contexte : dans une évaluation publiée le 6 octobre, OpenAI a comparé GPT‑6 Astra et GPT‑5.6 Sol sur 11 tâches liées aux processus juridiques, commerciaux et d’approvisionnement d’Ironclad. Les résultats portent sur un ensemble de recherche, et non sur l’ensemble des flux de travail de la plateforme.
Sujet visuel : gestion des contrats, flux de travail juridiques, documents de bureau, ordinateur, Unsplash
OpenAI · Image générée par IA

Les tâches couvraient les activités juridiques, commerciales et d’approvisionnement : par exemple, configurer un accord de confidentialité, créer des circuits d’approbation des achats et modifier une clause juridique standard en fonction de la juridiction choisie. OpenAI décrit l’objectif de l’étude comme une vérification de la capacité d’un agent à mener un processus en plusieurs étapes, tout en respectant les règles métier et en comparant le résultat aux exigences initiales.

Comment l’exécution a été mesurée

Des employés d’Ironclad et des personnes utilisant Ironclad chez OpenAI ont contribué à définir les 11 tâches. Chacune était évaluée selon 8 à 50 critères, en fonction de sa complexité. Pour entraîner les modèles, Ironclad a fourni des environnements hébergés de son logiciel ; OpenAI indique avoir amélioré les modèles à l’aide de tâches synthétiques et de l’apprentissage par renforcement.

La comparaison a utilisé les paramètres auxquels chaque modèle avait obtenu son meilleur score : Max reasoning pour Astra et High reasoning pour Sol. Selon le tableau publié par OpenAI, le temps moyen estimé par tentative était de 19,2 minutes pour Astra et de 37,0 minutes pour Sol. Il s’agit d’estimations simulées fondées sur les vitesses supposées de traitement et de génération, et non d’une réduction du temps mesurée chez les clients.

Ce que montrent les résultats

L’évaluation montre comment tester un agent informatique à partir de l’état final d’un flux de travail complexe : un ensemble de critères permet de voir quelles exigences le système a satisfaites et lesquelles il a omises. Pour les entreprises qui évaluent des outils de ce type, le repère pratique consiste à vérifier non seulement les actions isolées dans l’interface, mais aussi la façon dont le processus configuré gère différentes conditions, telles que les seuils d’approbation et les exceptions.

Unsplash Power
Domenico Loia · Licence Unsplash

Les chiffres concernent 11 tâches de recherche et ne décrivent pas l’ensemble des flux de travail d’Ironclad. Dans un exemple distinct présenté dans la publication, Astra a satisfait environ 94 % des critères en 20 minutes estimées, contre environ 85 % en 32 minutes pour Sol ; il s’agit d’un exemple portant sur une seule tâche, et non de résultats moyens. OpenAI indique également que les tâches synthétiques ont été créées à partir de contrats publics issus de la base SEC EDGAR, après filtrage des données personnelles ; selon l’entreprise, les contrats confidentiels des clients n’ont pas été utilisés pour l’entraînement ni l’évaluation.

Sunita Verma, directrice technique d’Ironclad, a souligné l’importance d’une vision globale du flux de travail. Traduction d’une citation de la publication d’OpenAI : « Les agents doivent comprendre tout le cycle de vie d’un contrat, y compris les liens entre les flux de travail, tout en préservant le contrôle sur lequel les équipes comptent. »

OpenAI présente cette collaboration comme un travail de recherche sur l’entraînement et l’évaluation des modèles. Les scores publiés donnent une indication des résultats sur les tâches sélectionnées ; la publication ne fournit ni vérification indépendante de l’évaluation ni mesures des performances sur un éventail plus large de processus clients.

Keep readingGitHub lance ReviewBench : les réviseurs IA seront comparés selon les défauts détectés
Read the next article

Articles similaires

Breaking News · Actualités

GitHub lance ReviewBench : les réviseurs IA seront comparés selon les défauts détectés

Le 5 octobre, GitHub a présenté ReviewBench, un aperçu de recherche d’un benchmark pour les agents de revue de code. Ses métriques distinguent les problèmes détectés, les omissions et le bruit superflu ; les résultats du test A/B interne de l’entreprise décrivent une expérience particulière, et non un classement général des modèles.

Launches · Actualités

Mistral Large 4 est disponible via API — les poids ouverts sont prévus plus tard

Mistral a ouvert l’accès à Large 4 pour des tests via API et prévoit de publier les poids fin octobre. La documentation décrit un modèle MoE avec une entrée multimodale et un contexte pouvant atteindre un million de tokens ; les chiffres de paramètres publiés dans la documentation et l’annonce diffèrent.

Transformez vos lectures en intégration fonctionnelle

Explorez les API de données sociales de jsonscraper, testez des requêtes et créez votre prochain workflow.

Explorer les API