jsonscraper

OpenAI en Ironclad beoordeelden AI-agenten op 11 contracttaken

GPT‑6 Astra behaalde gemiddeld 55% volgens de criteria van OpenAI; de uitvoeringstijd werd door het bedrijf gesimuleerd

OpenAI en Ironclad publiceerden op 6 oktober 2026 de resultaten van een onderzoeksevaluatie van AI-agenten die contractprocessen in bedrijfssoftware uitvoeren. Voor de 11 taken behaalde GPT‑6 Astra een gemiddelde score van 55,0% op de uitvoeringscriteria, tegenover 41,6% voor GPT‑5.6 Sol.

OpenAI en Ironclad beoordeelden AI-agenten op 11 contracttaken
Context: In een op 6 oktober gepubliceerde evaluatie vergeleek OpenAI GPT‑6 Astra en GPT‑5.6 Sol op 11 taken in de juridische, commerciële en inkoopprocessen van Ironclad. De resultaten beschrijven een onderzoeksdataset, niet alle workflows van het platform.
Visual subject: contractmanagement, juridische workflow, kantoor, documenten, computer, Unsplash
OpenAI · AI-gegenereerde afbeelding

De taken omvatten juridisch, commercieel en inkoopwerk, zoals het instellen van een geheimhoudingsovereenkomst, het opzetten van inkoopgoedkeuringen en het aanpassen van een standaard juridische bepaling aan de gekozen jurisdictie. OpenAI beschrijft het onderzoeksdoel als het toetsen van het vermogen van een agent om een meerstapsproces te doorlopen, bedrijfsregels te handhaven en het resultaat te controleren aan de hand van de oorspronkelijke vereisten.

Hoe de uitvoering werd gemeten

Medewerkers van Ironclad en mensen die Ironclad bij OpenAI gebruiken, hielpen bij het definiëren van de 11 taken. Elke taak werd beoordeeld aan de hand van 8 tot 50 criteria, afhankelijk van de complexiteit. Ironclad stelde gehoste omgevingen van zijn software beschikbaar om de modellen te oefenen; OpenAI meldt dat het de modellen verbeterde met synthetische taken en reinforcement learning.

Voor de vergelijking werden de instellingen gebruikt waarmee elk model zijn hoogste score behaalde: Max reasoning voor Astra en High reasoning voor Sol. Volgens de gepubliceerde tabel van OpenAI bedroeg de berekende gemiddelde tijd per poging 19,2 minuten voor Astra en 37,0 minuten voor Sol. Dit zijn gesimuleerde schattingen op basis van de veronderstelde verwerkings- en generatiesnelheid, geen gemeten tijdsbesparing voor klanten.

Wat de resultaten laten zien

De evaluatie laat zien hoe een computeragent kan worden getoetst aan de eindtoestand van een complexe workflow: met een reeks criteria wordt zichtbaar aan welke eisen het systeem wel en niet heeft voldaan. Voor bedrijven die zulke tools beoordelen, is een praktische leidraad om niet alleen afzonderlijke handelingen in de interface te controleren, maar ook hoe een ingerichte workflow met verschillende voorwaarden omgaat, zoals goedkeuringsdrempels en uitzonderingen.

Unsplash Power
Domenico Loia · Unsplash-licentie

De cijfers hebben betrekking op 11 onderzoekstaken en beschrijven niet alle workflows van Ironclad. In een afzonderlijk voorbeeld uit de publicatie voltooide Astra ongeveer 94% van de criteria in naar schatting 20 minuten, terwijl Sol ongeveer 85% behaalde in 32 minuten; dit is een voorbeeld van één taak, geen gemiddelde score. OpenAI vermeldt ook dat de synthetische taken zijn opgesteld op basis van openbare contracten uit de SEC EDGAR-database, nadat persoonsgegevens waren gefilterd; volgens het bedrijf zijn vertrouwelijke klantcontracten niet gebruikt voor training of evaluatie.

Sunita Verma, technisch directeur van Ironclad, benadrukte het belang van een end-to-end workflow. In vertaling van het citaat uit de publicatie van OpenAI: “Agenten moeten de volledige levenscyclus van een contract begrijpen, inclusief de samenhang tussen workflows, en de controle behouden waarop teams vertrouwen.”

OpenAI noemt de samenwerking onderzoek naar het trainen en evalueren van modellen. De gepubliceerde scores geven inzicht in de resultaten op de geselecteerde taken; de publicatie bevat geen onafhankelijke controle van de evaluatie of metingen van de prestaties op een bredere reeks klantprocessen.

Keep readingGitHub opent ReviewBench: AI-reviewers worden vergeleken op gevonden fouten
Read the next article

Gerelateerde artikelen

Breaking News · Nieuws

GitHub opent ReviewBench: AI-reviewers worden vergeleken op gevonden fouten

Op 5 oktober introduceerde GitHub ReviewBench, een onderzoekspreview van een benchmark voor agents die code controleren. De meetwaarden maken onderscheid tussen gevonden problemen, gemiste problemen en overbodige ruis. De resultaten van een interne A/B-test van het bedrijf beschrijven een afzonderlijk experiment, geen algemene ranglijst van modellen.

Launches · Nieuws

Mistral Large 4 nu beschikbaar via API — open gewichten later beloofd

Mistral heeft Large 4 beschikbaar gesteld om via de API te testen en plant de release van de gewichten voor eind oktober. De documentatie beschrijft een MoE-model met multimodale invoer en een contextvenster van maximaal één miljoen tokens; de gepubliceerde aantallen parameters in de documentatie en de aankondiging verschillen.

Maak van wat je leest een werkende integratie

Ontdek de socialdata-API's van jsonscraper, test aanvragen en bouw je volgende workflow.

API's verkennen