OpenAI en Ironclad publiceerden op 6 oktober 2026 de resultaten van een onderzoeksevaluatie van AI-agenten die contractprocessen in bedrijfssoftware uitvoeren. Voor de 11 taken behaalde GPT‑6 Astra een gemiddelde score van 55,0% op de uitvoeringscriteria, tegenover 41,6% voor GPT‑5.6 Sol.

De taken omvatten juridisch, commercieel en inkoopwerk, zoals het instellen van een geheimhoudingsovereenkomst, het opzetten van inkoopgoedkeuringen en het aanpassen van een standaard juridische bepaling aan de gekozen jurisdictie. OpenAI beschrijft het onderzoeksdoel als het toetsen van het vermogen van een agent om een meerstapsproces te doorlopen, bedrijfsregels te handhaven en het resultaat te controleren aan de hand van de oorspronkelijke vereisten.
Hoe de uitvoering werd gemeten
Medewerkers van Ironclad en mensen die Ironclad bij OpenAI gebruiken, hielpen bij het definiëren van de 11 taken. Elke taak werd beoordeeld aan de hand van 8 tot 50 criteria, afhankelijk van de complexiteit. Ironclad stelde gehoste omgevingen van zijn software beschikbaar om de modellen te oefenen; OpenAI meldt dat het de modellen verbeterde met synthetische taken en reinforcement learning.
Voor de vergelijking werden de instellingen gebruikt waarmee elk model zijn hoogste score behaalde: Max reasoning voor Astra en High reasoning voor Sol. Volgens de gepubliceerde tabel van OpenAI bedroeg de berekende gemiddelde tijd per poging 19,2 minuten voor Astra en 37,0 minuten voor Sol. Dit zijn gesimuleerde schattingen op basis van de veronderstelde verwerkings- en generatiesnelheid, geen gemeten tijdsbesparing voor klanten.
Wat de resultaten laten zien
De evaluatie laat zien hoe een computeragent kan worden getoetst aan de eindtoestand van een complexe workflow: met een reeks criteria wordt zichtbaar aan welke eisen het systeem wel en niet heeft voldaan. Voor bedrijven die zulke tools beoordelen, is een praktische leidraad om niet alleen afzonderlijke handelingen in de interface te controleren, maar ook hoe een ingerichte workflow met verschillende voorwaarden omgaat, zoals goedkeuringsdrempels en uitzonderingen.
De cijfers hebben betrekking op 11 onderzoekstaken en beschrijven niet alle workflows van Ironclad. In een afzonderlijk voorbeeld uit de publicatie voltooide Astra ongeveer 94% van de criteria in naar schatting 20 minuten, terwijl Sol ongeveer 85% behaalde in 32 minuten; dit is een voorbeeld van één taak, geen gemiddelde score. OpenAI vermeldt ook dat de synthetische taken zijn opgesteld op basis van openbare contracten uit de SEC EDGAR-database, nadat persoonsgegevens waren gefilterd; volgens het bedrijf zijn vertrouwelijke klantcontracten niet gebruikt voor training of evaluatie.
Sunita Verma, technisch directeur van Ironclad, benadrukte het belang van een end-to-end workflow. In vertaling van het citaat uit de publicatie van OpenAI: “Agenten moeten de volledige levenscyclus van een contract begrijpen, inclusief de samenhang tussen workflows, en de controle behouden waarop teams vertrouwen.”
OpenAI noemt de samenwerking onderzoek naar het trainen en evalueren van modellen. De gepubliceerde scores geven inzicht in de resultaten op de geselecteerde taken; de publicatie bevat geen onafhankelijke controle van de evaluatie of metingen van de prestaties op een bredere reeks klantprocessen.
Vertaling van het citaat: “Agenten moeten de volledige levenscyclus van een contract begrijpen, inclusief de samenhang tussen workflows, en de controle behouden waarop teams vertrouwen.”