jsonscraper

OpenAI og Ironclad evaluerte KI-agenter på 11 kontraktsoppgaver

GPT‑6 Astra fikk i gjennomsnitt 55 % etter OpenAIs kriterier; tidsbruken ble anslått ved simulering

OpenAI og Ironclad publiserte resultatene fra en forskningsevaluering 6. oktober 2026 av KI-agenter som arbeider med kontraktsprosesser i bedriftsprogramvare. På 11 oppgaver fikk GPT‑6 Astra en gjennomsnittlig poengsum på 55,0 % etter kriteriene for oppgaveløsning, mens GPT‑5.6 Sol fikk 41,6 %.

OpenAI og Ironclad evaluerte KI-agenter på 11 kontraktsoppgaver
Context: I en evaluering publisert 6. oktober sammenlignet OpenAI GPT‑6 Astra og GPT‑5.6 Sol på 11 oppgaver innen juridiske prosesser, kommersielle prosesser og innkjøp i Ironclad. Resultatene gjelder et forskningssett, ikke alle arbeidsflytene på plattformen.
Visual subject: contract management legal workflow office documents computer Unsplash
OpenAI · KI-generert bilde

Oppgavene omfattet juridisk arbeid, kommersielt arbeid og innkjøp. Eksempler var å sette opp en taushetserklæring, opprette godkjenningsprosesser for innkjøp og endre en standard juridisk klausul med hensyn til valgt jurisdiksjon. OpenAI beskriver målet med studien som å undersøke om en agent kan gjennomføre en flertrinnsprosess, samtidig som den følger forretningsregler og kontrollerer resultatet mot de opprinnelige kravene.

Slik ble oppgaveløsningen målt

Ansatte i Ironclad og personer som bruker Ironclad i OpenAI, bidro til å definere de 11 oppgavene. Hver oppgave ble vurdert etter 8–50 kriterier, avhengig av kompleksiteten. Ironclad stilte egne programvaremiljøer til rådighet for modelltreningen. OpenAI opplyser at selskapet forbedret modellene ved hjelp av syntetiske oppgaver og forsterkende læring.

Sammenligningen brukte innstillingene der hver modell fikk sin høyeste poengsum: Max reasoning for Astra og High reasoning for Sol. Ifølge OpenAIs publiserte tabell var den gjennomsnittlige estimerte tiden per forsøk 19,2 minutter for Astra og 37,0 minutter for Sol. Dette er simulerte anslag basert på antatt behandlings- og genereringshastighet, ikke en målt tidsbesparelse for kundene.

Hva resultatene viser

Evalueringen viser hvordan en datamaskinagent kan vurderes ut fra sluttilstanden i en kompleks arbeidsflyt: Et sett med kriterier gjør det mulig å se hvilke krav systemet oppfylte, og hvilke det overså. For selskaper som vurderer lignende verktøy, er det praktisk å undersøke ikke bare enkeltstående handlinger i grensesnittet, men også hvordan en konfigurert prosess håndterer ulike betingelser, som godkjenningsterskler og unntak.

Unsplash Power
Domenico Loia · Unsplash-lisens

Tallene gjelder 11 forskningsoppgaver og beskriver ikke alle arbeidsflytene i Ironclad. I et separat eksempel fra publikasjonen oppfylte Astra rundt 94 % av kriteriene på anslagsvis 20 minutter, mens Sol oppfylte rundt 85 % på 32 minutter. Dette er et eksempel på én oppgave, ikke gjennomsnittstall. OpenAI opplyser også at de syntetiske oppgavene ble laget med utgangspunkt i offentlige kontrakter fra SEC EDGAR-databasen, etter at personopplysninger var filtrert bort. Ifølge selskapet ble ikke kundenes private kontrakter brukt til trening eller evaluering.

Sunita Verma, teknologidirektør i Ironclad, understreket hvor viktig det er å se arbeidsflyten som en helhet. Oversatt fra sitatet i OpenAIs publikasjon: «Agenter må forstå hele kontraktens livssyklus, inkludert hvordan arbeidsflyter henger sammen, og bevare kontrollen teamene er avhengige av.»

OpenAI omtaler samarbeidet som forskningsarbeid med opplæring og evaluering av modeller. De publiserte poengsummene gir et innblikk i resultatene på de utvalgte oppgavene; publikasjonen inneholder ikke en uavhengig verifisering av evalueringen eller målinger fra et bredere utvalg av kundeprosesser.

Keep readingGitHub lanserer ReviewBench: KI-kodegranskere skal sammenlignes ut fra feilene de finner
Read the next article

Relaterte artikler

Launches · Nyheter

Mistral Large 4 er nå tilgjengelig via API – åpne vekter kommer senere

Mistral har åpnet Large 4 for testing via API og planlegger å publisere vektene mot slutten av oktober. Dokumentasjonen beskriver en MoE-modell med multimodal inndata og en kontekst på opptil én million tokener; de publiserte parameterantallene er ulike i dokumentasjonen og kunngjøringen.

Gjør det du leser til en fungerende integrasjon

Utforsk jsonscrapers API-er for sosiale data, test forespørsler og bygg neste arbeidsflyt.

Utforsk API-er