OpenAI og Ironclad publiserte resultatene fra en forskningsevaluering 6. oktober 2026 av KI-agenter som arbeider med kontraktsprosesser i bedriftsprogramvare. På 11 oppgaver fikk GPT‑6 Astra en gjennomsnittlig poengsum på 55,0 % etter kriteriene for oppgaveløsning, mens GPT‑5.6 Sol fikk 41,6 %.

Oppgavene omfattet juridisk arbeid, kommersielt arbeid og innkjøp. Eksempler var å sette opp en taushetserklæring, opprette godkjenningsprosesser for innkjøp og endre en standard juridisk klausul med hensyn til valgt jurisdiksjon. OpenAI beskriver målet med studien som å undersøke om en agent kan gjennomføre en flertrinnsprosess, samtidig som den følger forretningsregler og kontrollerer resultatet mot de opprinnelige kravene.
Slik ble oppgaveløsningen målt
Ansatte i Ironclad og personer som bruker Ironclad i OpenAI, bidro til å definere de 11 oppgavene. Hver oppgave ble vurdert etter 8–50 kriterier, avhengig av kompleksiteten. Ironclad stilte egne programvaremiljøer til rådighet for modelltreningen. OpenAI opplyser at selskapet forbedret modellene ved hjelp av syntetiske oppgaver og forsterkende læring.
Sammenligningen brukte innstillingene der hver modell fikk sin høyeste poengsum: Max reasoning for Astra og High reasoning for Sol. Ifølge OpenAIs publiserte tabell var den gjennomsnittlige estimerte tiden per forsøk 19,2 minutter for Astra og 37,0 minutter for Sol. Dette er simulerte anslag basert på antatt behandlings- og genereringshastighet, ikke en målt tidsbesparelse for kundene.
Hva resultatene viser
Evalueringen viser hvordan en datamaskinagent kan vurderes ut fra sluttilstanden i en kompleks arbeidsflyt: Et sett med kriterier gjør det mulig å se hvilke krav systemet oppfylte, og hvilke det overså. For selskaper som vurderer lignende verktøy, er det praktisk å undersøke ikke bare enkeltstående handlinger i grensesnittet, men også hvordan en konfigurert prosess håndterer ulike betingelser, som godkjenningsterskler og unntak.
Tallene gjelder 11 forskningsoppgaver og beskriver ikke alle arbeidsflytene i Ironclad. I et separat eksempel fra publikasjonen oppfylte Astra rundt 94 % av kriteriene på anslagsvis 20 minutter, mens Sol oppfylte rundt 85 % på 32 minutter. Dette er et eksempel på én oppgave, ikke gjennomsnittstall. OpenAI opplyser også at de syntetiske oppgavene ble laget med utgangspunkt i offentlige kontrakter fra SEC EDGAR-databasen, etter at personopplysninger var filtrert bort. Ifølge selskapet ble ikke kundenes private kontrakter brukt til trening eller evaluering.
Sunita Verma, teknologidirektør i Ironclad, understreket hvor viktig det er å se arbeidsflyten som en helhet. Oversatt fra sitatet i OpenAIs publikasjon: «Agenter må forstå hele kontraktens livssyklus, inkludert hvordan arbeidsflyter henger sammen, og bevare kontrollen teamene er avhengige av.»
OpenAI omtaler samarbeidet som forskningsarbeid med opplæring og evaluering av modeller. De publiserte poengsummene gir et innblikk i resultatene på de utvalgte oppgavene; publikasjonen inneholder ikke en uavhengig verifisering av evalueringen eller målinger fra et bredere utvalg av kundeprosesser.
Oversatt sitat: «Agenter må forstå hele kontraktens livssyklus, inkludert hvordan arbeidsflyter henger sammen, og bevare kontrollen teamene er avhengige av.»